
关于性能测试的评分,近期出现了一些异常现象。
9月8日,分析机构SemiAnalysis连续发布五条推文,直接指出谷歌和Meta这两家市值超过万亿美元的企业——
Gemini 3.8 Flash和Muse Spark 1.3是「刷榜行为最显著的两种模型」。

相关证据十分明确。
在用于评估Agent实际任务执行能力的Terminal-Bench 2.1排行榜中,Gemini 3.8 Flash获得了89.4分,在182个模型中位居第二,甚至超越了GPT-6 Astra。
然而,当切换到8月29日刚刚推出的Terminal-Bench 4.0时,同一模型仅得到19.1分,在14个测试对象中滑落至第12位,成绩直接缩水至原先的五分之一。
与此同时,GPT-6 Astra的得分从88.4降至57.7,相当于打了六五折。

仅过了27分钟,Meta首席AI官Alexandr Wang亲自现身评论区,直接回复了六个字,这是个愚昧的观点。
他指出,GPT-5.6 Sol在2.1版本中得分为88.8,在4.0版本中降至37.3,降幅更大,但并未有人指责Sol存在刷榜行为。
同时,他强调Meta从未声称Muse Spark 1.3能与Astra或Fable 5.1相匹敌,只是其性价比明显更高。

更换测试题目后,成绩大幅下滑
简单说明一下,Terminal-Bench用于衡量Agent的实际工作能力。
其方法是将一个终端和一个模糊目标交给模型,其余操作完全由其自主完成。然后,系统需要自行规划路径、调用工具、编写脚本,遇到错误还需自行修正。
在业界已使用大半年的2.1版本中,这两款模型的表现确实出色。
Gemini 3.8 Flash以89.4分排名第二,Muse Spark 1.3以88.8分位列第四,紧随其后的是88.4分的GPT-6 Astra和85.02分的Claude Fable 5.1。

令人惊讶的是,一个Flash级别的廉价模型和一款主打性价比的Meta新产品,竟然双双压制了两家顶级实验室的旗舰产品。
随后,4.0版本登场。
新试卷共包含66道题目,不仅删除了8道已被「攻克」的旧题,大幅修改了19道,还全部增加了8小时的超时限制。
防作弊机制同样达到了极高强度。
主办方不仅制定了35条评分细则,还增加了一轮专门的「对抗性作弊测试」,故意让Agent自行尝试钻奖励机制的空子,任何能成功钻空子的题目将被直接淘汰。
新榜单发布后,情况发生了急剧变化。

Claude Mythos 5.1(max)以60.9分保持稳定,GPT-6 Astra和Claude Fable 5.1分别以57.7分和55.8分紧随其后,再往下是52.3分的Claude Opus 5。上一代的GPT-5.6 Sol和Terra分别获得37.3分和23.6分。
相比之下,Gemini 3.8 Flash直接暴跌至19.1分。而根据SemiAnalysis提供的图表,Muse Spark 1.3的得分为33.3分。
总结来看。
在旧榜单上,Gemini 3.8 Flash还能压制GPT-6 Astra;在新榜单上,其分数甚至不及后者的三分之一,并被上一代的GPT-5.6 Terra超越。
无需直接抄袭答案,购买「模拟卷」即可
争论归争论,SemiAnalysis第二条推文中的点名才真正揭示了行业内部情况。
在他们看来,Terminal Bench 2.1的任务是完全公开的,Meta和谷歌绝不会愚蠢到直接使用原题进行训练,但他们肯定会购买数据,特别是那些被设计成与TB 2.1题型高度相似的训练数据。最终效果实际上与作弊无异。
而这,正是2026年刷榜的高级方式。

过去的「污染」方法较为粗糙,直接将原题混入预训练语料中让模型死记硬背。
这种行为很容易被查实,清洗一遍数据后成绩就会暴露原形。
业界在这方面曾多次受挫,例如HumanEval近四成样本被污染,GSM8K去污染后下降13分。最严重的是SWE-bench,更换一套私有代码库重新测试后,分数直接减半。
因此,现在大企业不再触碰原题,而是改为购买「看起来像考题的模拟卷」。即提供模型试错并给予奖励的封闭任务系统。
目前,这已成为一项明码标价的成熟业务。
单个训练任务售价在200到2000美元之间,复杂的软件工程任务甚至可达2万美元。
若要克隆一个网站作为UI训练场,大约需要2万美元。
如果需要复刻一个Slack规模的产品,则起步价为30万美元。
遇到要求独家买断的客户,价格还可再提高4到5倍。
根据Epoch AI的调查,Anthropic内部曾讨论过每年在此投入10亿美元。单季合同金额通常为六到七位数,有研究员透露平均每季度价格在30万到50万美元之间。
供给侧至少有35家公司从事这项业务,绝大多数是员工数不足20人的初创团队。老牌数据巨头也都在转型,Scale AI在Meta入股前营收已超过14亿,Surge的ARR也接近10亿。
当前局面非常奇特。
一方面是完全公开的榜单题库,另一方面是成熟的卖题产业链。想让模型在某个榜单上获得高分,无需费力作弊,直接花钱下单即可。
既做卖题机构,又当监考老师
随后,SemiAnalysis直接点名了一家名为Datacurve的公司。
在专门测试长周期编程的DeepSWE 1.1榜单上,Muse Spark 1.3(max)以75.4分获得第一,GPT-6 Astra和Claude Opus 5紧随其后,Gemini 3.8 Flash以73.8分排名第四。
被指控刷榜的两位,一个第一,一个第四。
想必,你已经发现了其中的问题。
这个榜单由Datacurve举办,而Datacurve的盈利方式恰好是向前沿实验室出售「专家级编码数据和强化学习环境」。
DeepSWE不仅是Datacurve自家的基准测试,跑分还使用其自己运营的评测环境。
既充当卖题的辅导机构,又担任出卷的监考老师,可以说是彻底坐实了。

榜单的有效期,所剩无几
最后,SemiAnalysis顺势对整个行业的公开评测下了定论。
他们认为这归根结底是所有优质公开基准的必然结局。TB 4.0也不例外,它目前看起来还准确,仅仅是因为它才发布了两周。
只要它的题目仍然是公开的,用不了多久就会被所有标榜「前沿」的实验室反复利用。

SemiAnalysis最终提出的解决方案非常直接,即多做高质量的私有基准。
方向是正确的,但代价同样高昂。
一旦评测全部私有化,公开榜单将彻底沦为各家的营销宣传材料。
真正具有区分度的真实成绩,只会在实验室和私有评测机构之间私下流动。
大企业当然乐见其成,毕竟闭卷考试谁也无法提前背题。
但对于广大开发者来说,那把用来公平衡量所有模型的公共标尺,恐怕再也找不回来了。
参考资料:
https://x.com/SemiAnalysis_/status/2097112791471522292
编辑:摩西
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。



想了解更多球友会官网入口相关内容,尽在球友会体育网站。