Scale AI 的新软件工程基准SWE-BENCH PRO,出现回转!
名义上看,"御三家"集体翻车,没一家的处治率越过25%:
GPT-5、Claude Opus 4.1、Gemini 2.5分辩以 23.3%、22.7%、13.5% 的处治率"荣"登前三。

但深刻数据背后,则保密精巧。
前 OpenAI 商酌员 Neil Chowdhury 示意,要是只看已提交的任务,GPT-5 能达到63%的准确率,比 Claude Opus 4.1 的31%,高了近一倍!

(这怎么不算 G 又赢!?)
换句话说,GPT-5 在擅长的题目上依旧隆重,与老基准 SWE-Bench-Verified 的 74.9% 差距不大,而 Claude 跟其他模子则径直拉垮到底。
那么,究竟是什么基准测试,让这些顶级模子如斯莫名?
先说论断,不是模子变菜了,而是题变难了。
与平均正确率高达70%的SWE-Bench-Verified比拟,SWE-BENCH PRO严格得可不啻一星半点。
一方面,当作 OpenAI 于 2024 年 8 月发布的测试集,SWE-Bench-Verified 中的好多代码库已被用作大说话模子的预西宾语料,存在着数据沾污的风险。
另一方面,SWE-Bench-Verified 还包含不少琐碎的问题,举例 500 个问题中有 161 个只需一两行修改。
这与工业软件工程中相通触及的跨多文献、数百行修改的场景差距较大,从而无法委果响应本色引诱场景中所濒临的挑战。
基于此,SWE-BENCH PRO 主打全新题目,以确保模子在西宾阶段从未斗争过测试内容,从而更确凿地锤真金不怕火模子的本色才能。

涵盖 1865 个买卖诈欺、B2B 管事和引诱者器具的多元化代码库
具体来说,SWE-BENCH PRO 将这些代码库构建为以下三个子集:
全球集:来自继承 copy-left 许可证的 11 个全球代码库的 731 个问题。
买卖集:来自 276 个源自初创公司代码库的问题。
保留集:来自继承 copy-left 许可证的 12 个全球代码库的 858 个问题。
(注:全球集将在 HuggingFace 上发布,买卖集和保留集保捏稀奇,买卖集的测试恶果会公开,保留集用于考据模子是否过拟合。每个问题由任务描写、联系测试集和可运转环境组成。)
这些从强 Copyleft 许可证(GPL)代码库和确凿的初创公司获取的买卖代码库大要灵验地处治 SWE-Bench-Verified 存在的数据沾污问题。
为了确保任务的复杂性,商酌团队还舍弃了像 1-10 行代码剪辑这么琐碎的剪辑,保留了需要进行大量多文献修改的问题。
此外,为了防卫模子对任何单一代码库产生过拟合,这些代码库齐处于活跃状况并隐蔽浮滥者诈欺、B2B 管事和引诱者器具平台。
接下来,就让咱们望望商酌者是如安在这些问题上进行测试的。
human in the loop 的测试秩序
为了将模子评估的重心放在当模子得到充分细节后,能否终了给定的引诱或补丁上。
商酌团队在 SWE-Bench Verified 的基础上,将 SWE-BENCH PRO 中的每个问题齐经由了东说念主工增强,并加入了问题述说、需求评释以及接口信息。
最初,商酌团队提供一个待处治问题的问题述说并在必要时补充高下文信息。

其次,针对潜在的歧义问题,关于每个问题,列出了一系列需求并指定相应的类和函数。

之后,在环境方面,每个任务齐在一个容器化的、用于特定说话的环境中进行评估。
在测试阶段,商酌通过fail2pass测西宾证问题是否已处治,通过pass2pass测试确保现存功能保捏完好。
其中,为了确保测试质料,fail2pass 测试会经由东说念主工筛选,去掉与任务不联系或过于泛泛的测试。
关于偶尔失败的测试,则会运转三次,以确保恶果踏实。
实验论断
正如咱们发轫提到的,大说话模子在 SWE-BENCH PRO 上的处治率仅为中等水平,远低于 SWE-Bench Verified 中的 70% 。

其中,在全球集上,GPT-5 和 Claude Opus 4.1 分辩终露馅 23.3% 和 22.7% 的最高处治率,显耀优于小鸿沟模子,Claude Sonnet 4 也达到了 16.3% 的处治率。
不外,像 DeepSeek Qwen-3 32B 和 GPT-4o 这么的老模子阐扬就几许有点不尽东说念成见了,仅为 3.4% 和 3.9%。

在买卖集上,即即是最优模子的得分也低于 20%。
这标明现时模子在处治确凿买卖场景中的问题时,才能仍然杰出有限。

针对这一苦涩的实验恶果,商酌东说念主员伸开了进一步的分析,论断如下:
最初,编程说话的难度、代码库以及模子的种类被视为影响模子阐扬的要津身分。
Go 和 Python 相通阐扬较好,一些模子在这些说话上的处治率越过 30%,而 JavaScript 和 TypeScript 则波动较大,从 0% 到越过 30% 不等。
不同代码库的处治率各别也很显豁,一些代码库广宽偏低(低于 10%),另一些则越过 50%。
前沿模子如 Claude Opus 4.1 和 GPT-5 在大多数编程说话和代码库中阐扬踏实,小鸿沟模子则更易出现接近零的处治率。
其次,不同的模子的失败原因时时各不交流。

OPUS 4.1 的主要失败步地是语义衔接不足,失实解答占 35.9%,语法失实占 24.2%,标明其技巧履行才能较强,但在问题衔接和算法正确性方面存在挑战。
GPT-5 的恶果夸耀在器具使用的灵验性上可能存在各别,但失实解答相对较少。
SONNET 4 的主要失败步地是高下文溢出(35.6%)和显耀的无停止文献读取行径(17.0%),标明其在高下文照应和文献导航计谋上存在局限。
GEMINI 2.5 的失败步地则较为平衡,涵盖器具失实(38.8%)、语法失实(30.5%)和失实解答(18.0%),夸耀其在多个维度上保捏了一定才能。
QWEN3 32B 当作开源模子,阐扬出最高的器具失实率(42.0%),突显了集成化器具使用关于高效代理的伏击性。
不出丑出,GPT-5 天然络续了以往"会就会,不会就不会"的答题计谋,但面对高企的未复兴率(63.1%),它的阐扬仍然不够看。
那么,谁会成为第一个打破 30% 的大模子呢?

参考衔接
[ 1 ] https://x.com/vbingliu
[ 2 ] https://scale.com/leaderboard/swe_bench_pro_public
[ 3 ] https://x.com/ChowdhuryNeil/status/1969817448229826798
[ 4 ] https://scale.com/research/swe_bench_pro
一键三连「点赞」「转发」「戒备心」
接待在驳倒区留住你的念念法!
— 完 —
� � 年度科技风向标「2025 东说念主工智能年度榜单」评比报名开启啦!咱们正在寻找 AI+ 时间领航者 点击了解细则
❤️� � 企业、居品、东说念主物 3 大维度,共设置了 5 类奖项,接待企业报名参与 � �
一键脸色 � � 点亮星标
科技前沿进展逐日见五联赛买球网