Skip to content

DeepSWE 从 7.3 到 54.4:这 7 倍里,有多少是模型的

封面

7 月 31 日,DeepSeek 上线 V4-Flash 正式版。这次更新有一句话很容易被跑分图盖过去:架构没变,参数没变,上下文长度也没变,只是重新做了一轮后训练。

然后成绩表看起来像换了一代模型。九项 agent 基准全线跃升,DeepSWE 从预览版的 7.3 涨到 54.4——7.4 倍;这个 13B 激活的小号 Flash,在全部九项上反超了参数更大的 V4-Pro 预览版。

如果只看这张图,结论很简单:后训练太值了。这个结论大体没错,但它站在一行脚注上面。脚注写着:这些编程 agent 任务,是用「尚未发布的 DeepSeek Harness 极简模式」跑出来的。

Harness——包在模型外面那层执行框架——决定了 agent 能用哪些工具、系统提示怎么写、上下文怎么压缩、报错怎么回喂、什么时候重试、什么时候停下来。它不是无关紧要的包装纸。

这篇文章想说清楚的判断是:一个 agent 跑分从来不是模型一个人挣来的,它是「模型 + 运行时」共同的产物,但榜单只署了模型的名字。 而近期一篇立场论文用受控实验给这件事标了价——换 harness 造成的分数波动,是换模型的 7.80 倍

一、九项全涨,但脚注只署了一个名字

V4-Flash 是一个 284B 总参数、每 token 激活 13B 的混合专家模型,原生 1M 上下文。7 月 31 日这些数字一个都没动,官方更新日志明确说只是重新做了后训练,价格也没涨(每百万 token 未命中缓存输入 0.14 美元、输出 0.28 美元)。

下面是官方公布的九项对照。整张表由 DeepSeek 自己发布,五列里除了它自家的三个版本,还并排放了 GLM-5.2 和 Claude Opus 4.8 两个竞品:

基准V4-Flash-0731V4-Flash 预览版V4-Pro 预览版GLM-5.2Opus-4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents' Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
DSBench-FullStack †68.737.041.861.871.6
DSBench-Hard †59.625.831.154.571.7

†为 DeepSeek 内部测试集。

涨幅最大的,恰恰是最需要"会干活"的那些项——它们不是知识问答,而是长工具循环:找文件、跑命令、改代码、读失败日志、再重试。编程 agent 得决定先看哪个文件、命令失败后要不要改计划、什么时候该停,这些行为完全可以在参数不变的前提下被教出来。之所以编程是后训练特别容易兑现的领域,是因为它有密集反馈:能不能编译、测试过不过、lint 指向哪一行,全都可以机器判定。不过这件事有另一面——verifier 的缺陷也会原样变成训练信号的缺陷。只奖励"测试通过",agent 就可能学会削弱测试、硬编码样例或利用环境漏洞,这正是上周那篇事故复盘里写过的失效模式。

而且有独立的交叉验证:Artificial Analysis 给 0731 大约 50 分的 Intelligence Index,比旧版高约 10 分。这一点后面还要用到——它说明"提升是真的"这件事,并不完全依赖 DeepSeek 自己那套 harness。

现在看那行小字。官方给这张表加了两条注释:一是公开的 Code Agent 任务用 DeepSeek Harness 的极简模式(to be released,尚未发布)作为 agent 框架,max 推理档位,temperature = 1.0top_p = 0.95;二是带 † 的两项为内部测试集。

注意第一条的措辞范围:它的主语是"DeepSeek-V4-Flash-0731 is evaluated with…",只点了 0731 这一个名字。表里另外四列用的是什么 harness、由谁跑出来的,模型卡一个字都没写。

这四列还要再分成两类。两个自家预览版大概率是重测的:这张表的 Terminal Bench 用的是 2.1,而 4 月旧模型卡上的成绩来自 2.0,设置也不同——口径既然换了,就说明是为这张表重新跑过的。但 GLM-5.2 和 Opus 4.8 的成绩没有任何交代:它们是 DeepSeek 自己跑出来的,还是从对方公开材料里引来的,模型卡没说。独立报道的定性是,整张对照表都属于厂商自述,截至发布日没有第三方复现。

这不是在指控谁作弊。厂商用自研 harness 跑自家模型是行业通例,DeepSeek 至少还把配置写进了脚注——很多发布连这个都没有。问题不在诚信,在归属:当一个数字由两个东西共同产生,而只有一个被署名,读者就无法判断该把功劳记给谁。

二、Harness 到底值多少分

"harness 很重要"这个观察本身不新。我在 3 月写《Harness Engineering:AI Agent 时代的新工程范式》、4 月写《Agent Harness 全景图》时讲的都是同一件事的实践面。新的是它终于被量出来了。

立场论文《Stop Comparing LLM Agents Without Disclosing the Harness》(arXiv:2605.23950)提出的命题叫绑定约束论:在长程任务上、在能力接近的前沿模型之间,agent 表现的方差主要由 harness 配置决定,而不是模型选择。当前榜单只报某一个未披露运行时下的单一分数,于是 harness 那部分方差根本不可测量。

先看公开榜单的证据(模型固定,只改基础设施):

基准固定的模型harness 变化分差
SWE-bench ProClaude Opus 4.5SEAL → Claude Code(45.9% → 55.4%)+9.5pp
SWE-bench VerifiedGrok 4SWE-agent → xAI 自研(58.6% → 72.5%)+14~16pp
Terminal-Bench 2.0固定提示词 + 中间件 + 校验(52.8% → 66.5%)+13.7pp
Agent 任务(Vercel)固定工具从 15 个砍到 2 个80% → 100%

第一行值得停一下:在标准化的 SEAL 脚手架下,六个前沿模型总共只差 4.9 个百分点;而锁定 Claude Opus 4.5 一个模型、只换 harness,就能差出 9.5 个百分点同一个模型换运行时的落差,是同一个运行时下六家顶级模型之间落差的两倍。 更极端的来自 HAL 在 SWE-bench Verified Mini 上的对比:同一个 Claude Sonnet 4.5 从 68% 掉到 34%,差 34 分;另有模型落差接近 48 分。

图 1:两把尺子不一样长。上路是锁定运行时后的跨模型差距——在标准化的 SEAL 脚手架下,六个前沿模型挤在 41.0% 到 45.9% 之间,极差只有 4.9 个百分点;下路是锁定模型后的跨运行时差距——同一个 Claude Opus 4.5 从 SEAL 换到 Claude Code,就从 45.9% 走到 55.4%,极差 9.5 个百分点,而最右侧那根红色条是 HAL 在 SWE-bench Verified Mini 上记录的极端情形,同一个模型从 68% 掉到 34%,另有模型落差接近 48。榜单只报上面这把尺子,下面那把从不出现在成绩单上

但公开榜单的数据是观察性的,不同 harness 由不同团队做出来,差异维度太多。所以论文自己做了一个受控网格:三个在编程榜单上紧挨着的模型,三种 harness 配置(从"无压缩无重试无校验"的极简,到加了自检、漂移检查、异常检测与检查点回滚的完整版),跑 SWE-bench Verified 的 100 题子集,环境、预算、超时全部固定。

模型H1 极简H2 改进H3 完整换 harness 的极差
GLM-5.152.556.565.513.0
GPT-5.455.058.563.58.5
Kimi K2.652.059.060.58.5
换模型的极差3.02.55.0

横着看,换 harness 能把同一个模型移动 8.5 到 13.0 分;竖着看,在固定 harness 里换模型只移动 2.5 到 5.0 分,方差比是 7.80 倍。比数字更要命的是排名:九组「模型对 × harness 对」的比较里,有六组发生了排名翻转——在这个网格里,"谁比谁强"多数情况下取决于你用哪套运行时来问。轨迹日志显示,提升来自降低控制噪声和闭合校验回路,都不是模型知识变多了。极差那一列还藏着一层信息:三个模型对 harness 的敏感度并不一致,GLM-5.1 的落差最大(13.0 分),它在极简配置下垫底、在完整配置下反而拿了全场最高的 65.5——这种"换套运行时就换个名次"的特性,在只报单一分数的榜单上完全看不见,却直接决定你自建 agent 时该在哪儿花力气。

顺带一提,Terminal-Bench 官方榜单其实已经承认了这个变量:每一行都是 (agent, model) 成对列出的,同一个模型会带着不同脚手架反复出现。榜单把 harness 摆上了台面,但发布通稿引用时通常会把它省掉。

这些证据也有边界。它是一篇立场论文,7.80 倍来自一个不大的网格——3 模型 × 3 harness、100 道题、每格两次运行,作者明确写了"不宣称这个比值普适"。命题的适用范围也限定在长程任务与能力接近的前沿模型之间,短问答里 harness 几乎不起作用。

三、那 7.4 倍怎么读

关键是把纵比和横比分开

纵比是可信的。 0731 和预览版都是 DeepSeek 自家模型、在同一张表里按同一批基准重新测出来的,同处一套运行时是站得住的推断——这接近论文推荐的"锁定 harness"协议。加上 Artificial Analysis 从外部确认了同一方向(约 +10 分),"这次后训练带来了很大提升"这个结论成立。

横比要打折扣,而且打多少折都算不出来。 关键不在于那两列竞品数字用了别的 harness,而在于模型卡压根没说它们是怎么来的。这就留下两种都说得通的可能:如果是 DeepSeek 拿别人的模型套自己的 harness 跑的,通常会低估对方,因为这套运行时是围着自家模型调的;如果是引用对方公开成绩,那就是两套完全不同的运行时并排。两种情形的偏差方向恰好相反,读者无从分辨。 于是 82.7 对 Opus 4.8 的 85.0 这 2.3 分,既可能被夸大也可能被压缩——按上一节那些数据,光运行时一项就能吃掉十几分。"V4-Flash 逼近 Opus 4.8"这个说法目前既没有证据支持,也没有证据否定,它只是还没被测量

图 2:一张成绩单的归属拆解。DeepSWE 54.4 由六个变量共同产生,按可核对程度分成三组:已披露可核对的只有架构与参数(本次一动没动)和推理档位(用的最高档 max);未披露因而无从判断的是后训练配方(仅说明"重做了一轮",数据组合、奖励设计与消融实验均未公开)和运行次数与随机种子(而 temperature 是 1.0);最后一组影响最大却没公开——执行 harness 是尚未发布的自研极简模式,任务版本则从 Terminal Bench 2.0 换成了 2.1

也要给 DeepSeek 留余地:提升是真的,独立评测确认了;待定的只是这次提升里有多少该记在 checkpoint 上、多少在运行时上。官方只说了"重做后训练",没给数据组合、奖励设计与消融实验,所以"找到了某个独门秘诀"这类说法目前都是猜测。最有说服力的下一步很明确——用同一个公开 runner、同样的预算与任务版本、多个随机种子,把预览版和 0731 一起重跑一遍,但在 DeepSeek Harness 公开之前,外界做不了。

四、落到工程上

优化预算的分配值得重新算一遍。 如果换 harness 的收益是换模型的数倍,"等下一代模型"就不是最优策略——LangChain 只靠 harness 工程就把 Terminal-Bench 2.0 成绩从 52.8% 提到 66.5%,远超模型代际之间通常两三分的差距。如果你的 agent 效果不好,先查运行时,别急着换模型。

自己测才是唯一算数的数字。 三条具体做法:要比模型就把它们放进同一套 harness,供应商必须用自研运行器时就把差异记录下来;每个任务跑三到五次,DeepSeek 自己推荐 temperature 1.0,方差本就是产品表现的一部分;比较的口径应该是每个被验收变更的成本,三分钱的失败重复十次,不一定比一次一美元的成功便宜。论文还提出了一份 ETCSOVG 七层披露清单(执行、工具、上下文、调度、可观测、校验、治理),任何一层变了都该重跑一组小规模验证。

结论

  • 一个 agent 分数是「模型 + 运行时」共同的产物,但只有前者被署名。 DeepSeek 把 harness 写进了脚注,已经比多数发布规范,可那条脚注只点了 0731 一个名字——旁边两列竞品成绩连测法都没交代。问题不在诚信,在归属。
  • 纵比可信,横比打折。 自家新旧版本是同一套运行时下的重测,加上独立评测 +10 分的印证,"后训练提升很大"成立;但 82.7 对 85.0 那 2.3 分,可能被自家 harness 低估,也可能来自完全不同的运行时,偏差方向相反且无从分辨。
  • harness 的杠杆可能比模型更长。 锁定脚手架时六个前沿模型只差 4.9 分,锁定模型只换 harness 差 9.5 分,HAL 记录的极端落差接近 48 分;受控网格里方差比 7.80 倍、九组比较六组排名翻转。效果不好先查运行时。

最后留个问题。厂商用自研 harness 报分是通例,而 harness 恰恰是他们最不愿公开的工程资产——它是产品竞争力本身。要求公开,等于要求交出护城河;不要求,跑分就永远是"模型 + 未知运行时"的合成数。

如果你是采购方,在拿不到 harness 的前提下,你会用什么办法把这两者拆开?

参考资料

  1. DeepSeek,《DeepSeek-V4-Flash-0731 模型卡与评测表》,Hugging Face,2026 年 7 月 31 日。https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
  2. DeepSeek,《API 更新日志:V4-Flash 正式版上线公测》,2026 年 7 月 31 日。https://api-docs.deepseek.com/updates
  3. Yunbei Zhang、Janet Wang、Yingqiang Ge、Weijie Xu、Jihun Hamm、Chandan K. Reddy(杜兰大学 / 罗格斯大学 / 弗吉尼亚理工),《Stop Comparing LLM Agents Without Disclosing the Harness》,arXiv:2605.23950。https://arxiv.org/abs/2605.23950
  4. NxCode Team,《DeepSeek V4 Flash 0731:一次后训练更新,如何重写编程智能体成本》,2026 年 8 月 1 日。https://www.nxcode.io/zh/resources/news/deepseek-v4-flash-0731-agent-economics-2026
  5. Artificial Analysis,DeepSeek V4 Flash 独立评测页。https://artificialanalysis.ai/models/deepseek-v4-flash
  6. Terminal-Bench 官方榜单(按 agent × model 成对列出)。https://www.tbench.ai/leaderboard
  7. Holistic Agent Leaderboard(HAL),跨脚手架对比数据。https://hal.cs.princeton.edu/
  8. ICE 数字实验室,《模型为了作弊,打穿了两家公司:Agent 安全的三处要害》,2026 年 7 月 27 日。
  9. ICE 数字实验室,《Agent Harness 全景图:谁在定义 AI Agent 的操作系统?》,2026 年 4 月 23 日。
  10. ICE 数字实验室,《Harness Engineering:AI Agent 时代的新工程范式》,2026 年 3 月 22 日。

本文部分内容由 AI 辅助生成,经人工审校和补充后发布。