部署高价值体育赛事数据解决方案……

谷歌Meta被锤刷榜

超过2000位体育迷分享他们的真实感受

关于性能测试的评分,近期出现了一些异常现象。 

9月8日,分析机构SemiAnalysis连续发布五条推文,直接指出谷歌和Meta这两家市值超过万亿美元的企业—— 

Gemini 3.8 Flash和Muse Spark 1.3是「刷榜行为最显著的两种模型」。

相关证据十分明确。 

在用于评估Agent实际任务执行能力的Terminal-Bench 2.1排行榜中,Gemini 3.8 Flash获得了89.4分,在182个模型中位居第二,甚至超越了GPT-6 Astra。 

然而,当切换到8月29日刚刚推出的Terminal-Bench 4.0时,同一模型仅得到19.1分,在14个测试对象中滑落至第12位,成绩直接缩水至原先的五分之一。 

与此同时,GPT-6 Astra的得分从88.4降至57.7,相当于打了六五折。 

仅过了27分钟,Meta首席AI官Alexandr Wang亲自现身评论区,直接回复了六个字,这是个愚昧的观点。

他指出,GPT-5.6 Sol在2.1版本中得分为88.8,在4.0版本中降至37.3,降幅更大,但并未有人指责Sol存在刷榜行为。 

同时,他强调Meta从未声称Muse Spark 1.3能与Astra或Fable 5.1相匹敌,只是其性价比明显更高。 

更换测试题目后,成绩大幅下滑

简单说明一下,Terminal-Bench用于衡量Agent的实际工作能力。 

其方法是将一个终端和一个模糊目标交给模型,其余操作完全由其自主完成。然后,系统需要自行规划路径、调用工具、编写脚本,遇到错误还需自行修正。 

在业界已使用大半年的2.1版本中,这两款模型的表现确实出色。 

Gemini 3.8 Flash以89.4分排名第二,Muse Spark 1.3以88.8分位列第四,紧随其后的是88.4分的GPT-6 Astra和85.02分的Claude Fable 5.1。 

令人惊讶的是,一个Flash级别的廉价模型和一款主打性价比的Meta新产品,竟然双双压制了两家顶级实验室的旗舰产品。 

随后,4.0版本登场。 

新试卷共包含66道题目,不仅删除了8道已被「攻克」的旧题,大幅修改了19道,还全部增加了8小时的超时限制。 

防作弊机制同样达到了极高强度。 

主办方不仅制定了35条评分细则,还增加了一轮专门的「对抗性作弊测试」,故意让Agent自行尝试钻奖励机制的空子,任何能成功钻空子的题目将被直接淘汰。 

新榜单发布后,情况发生了急剧变化。 

Claude Mythos 5.1(max)以60.9分保持稳定,GPT-6 Astra和Claude Fable 5.1分别以57.7分和55.8分紧随其后,再往下是52.3分的Claude Opus 5。上一代的GPT-5.6 Sol和Terra分别获得37.3分和23.6分。 

相比之下,Gemini 3.8 Flash直接暴跌至19.1分。而根据SemiAnalysis提供的图表,Muse Spark 1.3的得分为33.3分。 

总结来看。 

在旧榜单上,Gemini 3.8 Flash还能压制GPT-6 Astra;在新榜单上,其分数甚至不及后者的三分之一,并被上一代的GPT-5.6 Terra超越。 

无需直接抄袭答案,购买「模拟卷」即可

争论归争论,SemiAnalysis第二条推文中的点名才真正揭示了行业内部情况。 

在他们看来,Terminal Bench 2.1的任务是完全公开的,Meta和谷歌绝不会愚蠢到直接使用原题进行训练,但他们肯定会购买数据,特别是那些被设计成与TB 2.1题型高度相似的训练数据。最终效果实际上与作弊无异。 

而这,正是2026年刷榜的高级方式。 

过去的「污染」方法较为粗糙,直接将原题混入预训练语料中让模型死记硬背。 

这种行为很容易被查实,清洗一遍数据后成绩就会暴露原形。 

业界在这方面曾多次受挫,例如HumanEval近四成样本被污染,GSM8K去污染后下降13分。最严重的是SWE-bench,更换一套私有代码库重新测试后,分数直接减半。 

因此,现在大企业不再触碰原题,而是改为购买「看起来像考题的模拟卷」。即提供模型试错并给予奖励的封闭任务系统。 

目前,这已成为一项明码标价的成熟业务。 

单个训练任务售价在200到2000美元之间,复杂的软件工程任务甚至可达2万美元。

若要克隆一个网站作为UI训练场,大约需要2万美元。

如果需要复刻一个Slack规模的产品,则起步价为30万美元。

遇到要求独家买断的客户,价格还可再提高4到5倍。

根据Epoch AI的调查,Anthropic内部曾讨论过每年在此投入10亿美元。单季合同金额通常为六到七位数,有研究员透露平均每季度价格在30万到50万美元之间。 

供给侧至少有35家公司从事这项业务,绝大多数是员工数不足20人的初创团队。老牌数据巨头也都在转型,Scale AI在Meta入股前营收已超过14亿,Surge的ARR也接近10亿。 

当前局面非常奇特。 

一方面是完全公开的榜单题库,另一方面是成熟的卖题产业链。想让模型在某个榜单上获得高分,无需费力作弊,直接花钱下单即可。 

既做卖题机构,又当监考老师

随后,SemiAnalysis直接点名了一家名为Datacurve的公司。 

在专门测试长周期编程的DeepSWE 1.1榜单上,Muse Spark 1.3(max)以75.4分获得第一,GPT-6 Astra和Claude Opus 5紧随其后,Gemini 3.8 Flash以73.8分排名第四。 

被指控刷榜的两位,一个第一,一个第四。 

想必,你已经发现了其中的问题。 

这个榜单由Datacurve举办,而Datacurve的盈利方式恰好是向前沿实验室出售「专家级编码数据和强化学习环境」。 

DeepSWE不仅是Datacurve自家的基准测试,跑分还使用其自己运营的评测环境。 

既充当卖题的辅导机构,又担任出卷的监考老师,可以说是彻底坐实了。 

榜单的有效期,所剩无几

最后,SemiAnalysis顺势对整个行业的公开评测下了定论。 

他们认为这归根结底是所有优质公开基准的必然结局。TB 4.0也不例外,它目前看起来还准确,仅仅是因为它才发布了两周。 

只要它的题目仍然是公开的,用不了多久就会被所有标榜「前沿」的实验室反复利用。 

SemiAnalysis最终提出的解决方案非常直接,即多做高质量的私有基准。 

方向是正确的,但代价同样高昂。 

一旦评测全部私有化,公开榜单将彻底沦为各家的营销宣传材料。 

真正具有区分度的真实成绩,只会在实验室和私有评测机构之间私下流动。 

大企业当然乐见其成,毕竟闭卷考试谁也无法提前背题。 

但对于广大开发者来说,那把用来公平衡量所有模型的公共标尺,恐怕再也找不回来了。 

参考资料:

https://x.com/SemiAnalysis_/status/2097112791471522292

编辑:摩西

本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。

拓展你的赛事视野

下一篇