FlowPod AI
首页
DeepSWE:抗污染编码基准测试——James Shi, Datacurve
AI Engineer
AI Engineer/2026年7月27日

DeepSWE:抗污染编码基准测试——James Shi, Datacurve

AI工程基准测试数据污染软件工程DeepSWE模型评估
中文导读

DeepSWE 是一个全新的软件工程基准,包含 113 个从零编写的任务,避免模型在训练中见过。每个任务来自真实开源仓库,由维护者编写,配有隔离环境和基于程序的验证器。James Shi 指出,去除污染后,模型排名重新洗牌,强模型遥遥领先,而 Gemini 3.1 Pro 等则垫底。该基准还揭示了模型的失败模式,如过度扩展任务、不验证自身工作等。

核心观点
1.DeepSWE 的 113 个任务全部从零编写,不来自 PR,确保模型在训练中未见过,有效避免数据污染。(约 0:00)
2.每个任务由真实开源仓库的维护者编写,配有隔离环境和基于程序的验证器,检查可观察行为而非模型自述。(约 5:00)
3.去除污染后,模型排名不再聚集,强模型(如 Claude)表现突出,而 Gemini 3.1 Pro 等则跌至底部。(约 10:00)
4.模型失败模式值得关注:部分模型会悄悄扩展任务范围,Claude 模型出现此情况的比例较高,GPT 模型较低。(约 15:00)
5.强模型往往不验证自身工作,测试自己编写的代码与假设其正确之间存在明显差距。(约 20:00)
中文精读

DeepSWE 的验证器设计也值得关注。为了防止奖励黑客(reward hacking),验证器尽可能减少被游戏的可能,将分数锚定在客观行为上,而非模型生成的看似合理的解释。这种设计思路对于构建可靠的评估体系至关重要。对于中文开发者,了解这些细节有助于选择适合的基准,并理解模型在真实软件工程任务中的表现。

下一集
Jason Liu 分享在 OpenAI 使用 ChatGPT Work + Codex 的完整工作系统