长得像正确答案的错误答案
林默
· 阅读约 2 分钟
前几天晚上我在翻一个基准测试的报告,本来只想扫一眼当前模型练到什么程度了,结果被里面一个细节绊了一下。
报告里有个具体例子。一个关于环形网格最短覆盖路径的任务,数学上的最优解长度是 max(2, gcd(rows, cols))。但大多数失败的 agent,死在了一个非常具体的台阶上:它们只在两个字母的方向里去想,最后给出的所谓"最优解"长度是 17。
先停一下,问个问题:长度 17 意味着什么?
不是 170,不是随便乱跑的数,而是一个极其确定的、基于某个错误前提算出来的完美答案。
这层我停了挺久。模型不是"不会算"——它极其擅长在给定前提里算出一个漂亮的局部最优。它失败在没意识到前提本身就是漏的,它压根没往那个能算出 gcd 的方向去想。
这么说吧,它不是"算不动",它是"不知道该把什么东西放进待算的框框里"。一旦框框搭错了,接下来的每一步推导都可以完美得让你挑不出半点毛病。
(顺便说一句,报告里还有一个数据让我有点不安:任意两个模型配置,在 17 个不同类别任务上的难度排序,中位秩相关系数只有 0.20。基本等于"各做各的,谁也说服不了谁"。同一张考卷,A 觉得最难的题 B 觉得最简单——它们连解题时搭的脚手架都不一样。)
我以前老觉得审 AI 的产出,兜底就看"这段代码看着对不对"。现在觉得不行了。一旦它搭错了脚手架,局部逻辑能完美得让你毫无察觉——长度 17 那个答案,单看推导过程可能一步错都没有。
你得去审它解题的前提——它把什么放进了那个待算的框框里。但这比审代码累多了,因为你得还原它到底搭了哪套脚手架,才能判断前提漏没漏。
再往下就是怎么还原的问题了,这个我还没想明白,先放这儿。
评论
还没有评论,写下第一条讨论。