DeepSWE 从 7.3 到 54.4:这 7 倍里,有多少是模型的

7 月 31 日,DeepSeek 上线 V4-Flash 正式版。这次更新有一句话很容易被跑分图盖过去:架构没变,参数没变,上下文长度也没变,只是重新做了一轮后训练。
然后成绩表看起来像换了一代模型。九项 agent 基准全线跃升,DeepSWE 从预览版的 7.3 涨到 54.4——7.4 倍;这个 13B 激活的小号 Flash,在全部九项上反超了参数更大的 V4-Pro 预览版。
如果只看这张图,结论很简单:后训练太值了。这个结论大体没错,但它站在一行脚注上面。脚注写着:这些编程 agent 任务,是用「尚未发布的 DeepSeek Harness 极简模式」跑出来的。
Harness——包在模型外面那层执行框架——决定了 agent 能用哪些工具、系统提示怎么写、上下文怎么压缩、报错怎么回喂、什么时候重试、什么时候停下来。它不是无关紧要的包装纸。
这篇文章想说清楚的判断是:一个 agent 跑分从来不是模型一个人挣来的,它是「模型 + 运行时」共同的产物,但榜单只署了模型的名字。 而近期一篇立场论文用受控实验给这件事标了价——换 harness 造成的分数波动,是换模型的 7.80 倍。
一、九项全涨,但脚注只署了一个名字
V4-Flash 是一个 284B 总参数、每 token 激活 13B 的混合专家模型,原生 1M 上下文。7 月 31 日这些数字一个都没动,官方更新日志明确说只是重新做了后训练,价格也没涨(每百万 token 未命中缓存输入 0.14 美元、输出 0.28 美元)。
下面是官方公布的九项对照。整张表由 DeepSeek 自己发布,五列里除了它自家的三个版本,还并排放了 GLM-5.2 和 Claude Opus 4.8 两个竞品:
| 基准 | V4-Flash-0731 | V4-Flash 预览版 | V4-Pro 预览版 | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
†为 DeepSeek 内部测试集。
涨幅最大的,恰恰是最需要"会干活"的那些项——它们不是知识问答,而是长工具循环:找文件、跑命令、改代码、读失败日志、再重试。编程 agent 得决定先看哪个文件、命令失败后要不要改计划、什么时候该停,这些行为完全可以在参数不变的前提下被教出来。之所以编程是后训练特别容易兑现的领域,是因为它有密集反馈:能不能编译、测试过不过、lint 指向哪一行,全都可以机器判定。不过这件事有另一面——verifier 的缺陷也会原样变成训练信号的缺陷。只奖励"测试通过",agent 就可能学会削弱测试、硬编码样例或利用环境漏洞,这正是上周那篇事故复盘里写过的失效模式。
而且有独立的交叉验证:Artificial Analysis 给 0731 大约 50 分的 Intelligence Index,比旧版高约 10 分。这一点后面还要用到——它说明"提升是真的"这件事,并不完全依赖 DeepSeek 自己那套 harness。
现在看那行小字。官方给这张表加了两条注释:一是公开的 Code Agent 任务用 DeepSeek Harness 的极简模式(to be released,尚未发布)作为 agent 框架,max 推理档位,temperature = 1.0,top_p = 0.95;二是带 † 的两项为内部测试集。
注意第一条的措辞范围:它的主语是"DeepSeek-V4-Flash-0731 is evaluated with…",只点了 0731 这一个名字。表里另外四列用的是什么 harness、由谁跑出来的,模型卡一个字都没写。
这四列还要再分成两类。两个自家预览版大概率是重测的:这张表的 Terminal Bench 用的是 2.1,而 4 月旧模型卡上的成绩来自 2.0,设置也不同——口径既然换了,就说明是为这张表重新跑过的。但 GLM-5.2 和 Opus 4.8 的成绩没有任何交代:它们是 DeepSeek 自己跑出来的,还是从对方公开材料里引来的,模型卡没说。独立报道的定性是,整张对照表都属于厂商自述,截至发布日没有第三方复现。
这不是在指控谁作弊。厂商用自研 harness 跑自家模型是行业通例,DeepSeek 至少还把配置写进了脚注——很多发布连这个都没有。问题不在诚信,在归属:当一个数字由两个东西共同产生,而只有一个被署名,读者就无法判断该把功劳记给谁。
二、Harness 到底值多少分
"harness 很重要"这个观察本身不新。我在 3 月写《Harness Engineering:AI Agent 时代的新工程范式》、4 月写《Agent Harness 全景图》时讲的都是同一件事的实践面。新的是它终于被量出来了。
立场论文《Stop Comparing LLM Agents Without Disclosing the Harness》(arXiv:2605.23950)提出的命题叫绑定约束论:在长程任务上、在能力接近的前沿模型之间,agent 表现的方差主要由 harness 配置决定,而不是模型选择。当前榜单只报某一个未披露运行时下的单一分数,于是 harness 那部分方差根本不可测量。
先看公开榜单的证据(模型固定,只改基础设施):
| 基准 | 固定的模型 | harness 变化 | 分差 |
|---|---|---|---|
| SWE-bench Pro | Claude Opus 4.5 | SEAL → Claude Code(45.9% → 55.4%) | +9.5pp |
| SWE-bench Verified | Grok 4 | SWE-agent → xAI 自研(58.6% → 72.5%) | +14~16pp |
| Terminal-Bench 2.0 | 固定 | 提示词 + 中间件 + 校验(52.8% → 66.5%) | +13.7pp |
| Agent 任务(Vercel) | 固定 | 工具从 15 个砍到 2 个 | 80% → 100% |
第一行值得停一下:在标准化的 SEAL 脚手架下,六个前沿模型总共只差 4.9 个百分点;而锁定 Claude Opus 4.5 一个模型、只换 harness,就能差出 9.5 个百分点。同一个模型换运行时的落差,是同一个运行时下六家顶级模型之间落差的两倍。 更极端的来自 HAL 在 SWE-bench Verified Mini 上的对比:同一个 Claude Sonnet 4.5 从 68% 掉到 34%,差 34 分;另有模型落差接近 48 分。

但公开榜单的数据是观察性的,不同 harness 由不同团队做出来,差异维度太多。所以论文自己做了一个受控网格:三个在编程榜单上紧挨着的模型,三种 harness 配置(从"无压缩无重试无校验"的极简,到加了自检、漂移检查、异常检测与检查点回滚的完整版),跑 SWE-bench Verified 的 100 题子集,环境、预算、超时全部固定。
| 模型 | H1 极简 | H2 改进 | H3 完整 | 换 harness 的极差 |
|---|---|---|---|---|
| GLM-5.1 | 52.5 | 56.5 | 65.5 | 13.0 |
| GPT-5.4 | 55.0 | 58.5 | 63.5 | 8.5 |
| Kimi K2.6 | 52.0 | 59.0 | 60.5 | 8.5 |
| 换模型的极差 | 3.0 | 2.5 | 5.0 |
横着看,换 harness 能把同一个模型移动 8.5 到 13.0 分;竖着看,在固定 harness 里换模型只移动 2.5 到 5.0 分,方差比是 7.80 倍。比数字更要命的是排名:九组「模型对 × harness 对」的比较里,有六组发生了排名翻转——在这个网格里,"谁比谁强"多数情况下取决于你用哪套运行时来问。轨迹日志显示,提升来自降低控制噪声和闭合校验回路,都不是模型知识变多了。极差那一列还藏着一层信息:三个模型对 harness 的敏感度并不一致,GLM-5.1 的落差最大(13.0 分),它在极简配置下垫底、在完整配置下反而拿了全场最高的 65.5——这种"换套运行时就换个名次"的特性,在只报单一分数的榜单上完全看不见,却直接决定你自建 agent 时该在哪儿花力气。
顺带一提,Terminal-Bench 官方榜单其实已经承认了这个变量:每一行都是 (agent, model) 成对列出的,同一个模型会带着不同脚手架反复出现。榜单把 harness 摆上了台面,但发布通稿引用时通常会把它省掉。
这些证据也有边界。它是一篇立场论文,7.80 倍来自一个不大的网格——3 模型 × 3 harness、100 道题、每格两次运行,作者明确写了"不宣称这个比值普适"。命题的适用范围也限定在长程任务与能力接近的前沿模型之间,短问答里 harness 几乎不起作用。
三、那 7.4 倍怎么读
关键是把纵比和横比分开。
纵比是可信的。 0731 和预览版都是 DeepSeek 自家模型、在同一张表里按同一批基准重新测出来的,同处一套运行时是站得住的推断——这接近论文推荐的"锁定 harness"协议。加上 Artificial Analysis 从外部确认了同一方向(约 +10 分),"这次后训练带来了很大提升"这个结论成立。
横比要打折扣,而且打多少折都算不出来。 关键不在于那两列竞品数字用了别的 harness,而在于模型卡压根没说它们是怎么来的。这就留下两种都说得通的可能:如果是 DeepSeek 拿别人的模型套自己的 harness 跑的,通常会低估对方,因为这套运行时是围着自家模型调的;如果是引用对方公开成绩,那就是两套完全不同的运行时并排。两种情形的偏差方向恰好相反,读者无从分辨。 于是 82.7 对 Opus 4.8 的 85.0 这 2.3 分,既可能被夸大也可能被压缩——按上一节那些数据,光运行时一项就能吃掉十几分。"V4-Flash 逼近 Opus 4.8"这个说法目前既没有证据支持,也没有证据否定,它只是还没被测量。

也要给 DeepSeek 留余地:提升是真的,独立评测确认了;待定的只是这次提升里有多少该记在 checkpoint 上、多少在运行时上。官方只说了"重做后训练",没给数据组合、奖励设计与消融实验,所以"找到了某个独门秘诀"这类说法目前都是猜测。最有说服力的下一步很明确——用同一个公开 runner、同样的预算与任务版本、多个随机种子,把预览版和 0731 一起重跑一遍,但在 DeepSeek Harness 公开之前,外界做不了。
四、落到工程上
优化预算的分配值得重新算一遍。 如果换 harness 的收益是换模型的数倍,"等下一代模型"就不是最优策略——LangChain 只靠 harness 工程就把 Terminal-Bench 2.0 成绩从 52.8% 提到 66.5%,远超模型代际之间通常两三分的差距。如果你的 agent 效果不好,先查运行时,别急着换模型。
自己测才是唯一算数的数字。 三条具体做法:要比模型就把它们放进同一套 harness,供应商必须用自研运行器时就把差异记录下来;每个任务跑三到五次,DeepSeek 自己推荐 temperature 1.0,方差本就是产品表现的一部分;比较的口径应该是每个被验收变更的成本,三分钱的失败重复十次,不一定比一次一美元的成功便宜。论文还提出了一份 ETCSOVG 七层披露清单(执行、工具、上下文、调度、可观测、校验、治理),任何一层变了都该重跑一组小规模验证。
结论
- 一个 agent 分数是「模型 + 运行时」共同的产物,但只有前者被署名。 DeepSeek 把 harness 写进了脚注,已经比多数发布规范,可那条脚注只点了 0731 一个名字——旁边两列竞品成绩连测法都没交代。问题不在诚信,在归属。
- 纵比可信,横比打折。 自家新旧版本是同一套运行时下的重测,加上独立评测 +10 分的印证,"后训练提升很大"成立;但 82.7 对 85.0 那 2.3 分,可能被自家 harness 低估,也可能来自完全不同的运行时,偏差方向相反且无从分辨。
- harness 的杠杆可能比模型更长。 锁定脚手架时六个前沿模型只差 4.9 分,锁定模型只换 harness 差 9.5 分,HAL 记录的极端落差接近 48 分;受控网格里方差比 7.80 倍、九组比较六组排名翻转。效果不好先查运行时。
最后留个问题。厂商用自研 harness 报分是通例,而 harness 恰恰是他们最不愿公开的工程资产——它是产品竞争力本身。要求公开,等于要求交出护城河;不要求,跑分就永远是"模型 + 未知运行时"的合成数。
如果你是采购方,在拿不到 harness 的前提下,你会用什么办法把这两者拆开?
参考资料
- DeepSeek,《DeepSeek-V4-Flash-0731 模型卡与评测表》,Hugging Face,2026 年 7 月 31 日。https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
- DeepSeek,《API 更新日志:V4-Flash 正式版上线公测》,2026 年 7 月 31 日。https://api-docs.deepseek.com/updates
- Yunbei Zhang、Janet Wang、Yingqiang Ge、Weijie Xu、Jihun Hamm、Chandan K. Reddy(杜兰大学 / 罗格斯大学 / 弗吉尼亚理工),《Stop Comparing LLM Agents Without Disclosing the Harness》,arXiv:2605.23950。https://arxiv.org/abs/2605.23950
- NxCode Team,《DeepSeek V4 Flash 0731:一次后训练更新,如何重写编程智能体成本》,2026 年 8 月 1 日。https://www.nxcode.io/zh/resources/news/deepseek-v4-flash-0731-agent-economics-2026
- Artificial Analysis,DeepSeek V4 Flash 独立评测页。https://artificialanalysis.ai/models/deepseek-v4-flash
- Terminal-Bench 官方榜单(按 agent × model 成对列出)。https://www.tbench.ai/leaderboard
- Holistic Agent Leaderboard(HAL),跨脚手架对比数据。https://hal.cs.princeton.edu/
- ICE 数字实验室,《模型为了作弊,打穿了两家公司:Agent 安全的三处要害》,2026 年 7 月 27 日。
- ICE 数字实验室,《Agent Harness 全景图:谁在定义 AI Agent 的操作系统?》,2026 年 4 月 23 日。
- ICE 数字实验室,《Harness Engineering:AI Agent 时代的新工程范式》,2026 年 3 月 22 日。
本文部分内容由 AI 辅助生成,经人工审校和补充后发布。