Skip to content

两个 Yao Shunyu:一场关于 AI 下半场的隔空辩论

封面

硅谷 AI 圈有个流传已久的段子:有两个 Yao Shunyu,名字念起来一模一样,还是清华同一届的校友,连跳槽都赶在同一年——以至于播客主持人每次请其中一位,都得先花半分钟跟听众解释"今天来的是哪个"。

但真正有意思的,不是这个同音的巧合,而是这两个 Yao Shunyu,正好站在了当下 AI 两条根本路线的两端——而且他们连"我们现在打到 AI 的哪个阶段了"都吵起来了。 一个断言"上半场已经结束",一个坚持"上半场远没打完"。这篇文章想借这场隔空辩论,把这两条路线讲清楚。

一、先分清:谁是雨,谁是宇

先把两个人对上号,免得跟那些主持人一样犯迷糊。

姚顺雨(雨):清华姚班出身,普林斯顿计算机博士,在 OpenAI 期间是 Agent 领域最前沿的探索者之一——ReAct、Tree of Thoughts、SWE-bench 这些今天被反复引用的框架和基准,都出自他手。2025 年他从 OpenAI 跳到腾讯,出任首席 AI 科学家,主导混元大模型的重构。

姚顺宇(宇):清华基础科学班、斯坦福理论物理博士,研究过非厄米系统、量子与高能物理,是个不折不扣的"物理转 AI"。他 2024 年加入 Anthropic,参与 Claude 3.7、4.5 的大规模强化学习训练;2025 年 9 月转投 Google DeepMind,任资深研究科学家,参与 Gemini 3 等模型开发。

一个是计算机科班、扎进产品与 Agent 的应用泥土;一个是物理背景、仰望预训练与系统的底层星空。同一个名字,两种气质,两条路。

二、姚顺雨(雨):上半场结束了,Context 才是考点

用好 Context,比拉长文本更难

姚顺雨最出圈的一篇文章是 2025 年的《The Second Half》。他抛出的判断很锋利:AI 的上半场,主题是"把模型训得更强",靠通用配方(预训练 + RL + 推理)一路刷分;但上半场已经打完了——从现在起,重心要从"解决问题"转向"定义问题",评估比训练更重要,做 AI 的人得开始像产品经理那样思考:我们到底该让 AI 做什么、又该怎么衡量它真的有用。

这不是空谈。他到腾讯后的第一篇署名论文,就是给这个判断钉了个钉子——2026 年 2 月,腾讯混元联合复旦发布 CL-bench(上下文学习基准)。它的设计苛刻到近乎刁难:每道题所需的信息全都明明白白写在上下文里,但模型必须从这段上下文里现学预训练时没见过的新知识(虚构的法律体系、新定义的编程语法、实验数据里的隐藏规律……)再正确应用。结果很扎心——世界排名前十的模型,平均只解出 17.2% 的任务,表现最好的 GPT-5.1 也才 23.7%。 而在不给上下文时,它连 1% 都做不到。腾讯混元官方技术博客那篇《从上下文中学习,远比我们想象的要难》,给的结论毫不客气:即使是今天最强的模型,"在上下文的利用上仍然做得不好,甚至可以说还不会从上下文中学习"。

这条线一路往下推,指向的正是当前最热的 Agent 与 MCP 趋势:当单体模型的能力见顶,真正决定 Agent 值不值钱的,是喂给它的上下文干不干净、对不对得上业务。 姚顺雨更早主导的 τ-bench,测的是 Agent 能不能遵守领域规则、跟用户多轮周旋;CL-bench 又往前一步,测模型会不会现学现用。两个基准指向同一句话:真实世界要的是"学习能力",不是"做题能力"。 这也解释了他在混元的打法——回到"基本"、拉起 20 多人的团队专做最脏最累的数据审核、新设 AI Data 部,并主张跟产品深度 Co-Design、把真实场景的数据回流回来倒逼模型迭代。对社交与游戏基因的腾讯来说,海量的聊天记录、游戏状态、用户行为本就是天然的"动态上下文",死磕 Context,等于在给自己最核心的业务打地基。

三、姚顺宇(宇):上半场还没完,撞墙多半是你代码有 bug

算力硬堆的尽头,是聪明的蒸馏

如果说姚顺雨在宣布"下半场开始",姚顺宇则像是站出来泼了盆冷水:上半场根本没打完。 在一场近 4 小时的长访谈里,他反复强调:预训练远没到头,过去几个月一直在变强,未来几个月也看不到明显天花板。至于外界热议的"scaling law 撞墙",他的第一反应不是感慨规律失效,而是排障——"撞墙"多半有三种来源:真到了客观极限、科学假设设错了、或者最常见也最不体面的,系统里其实埋着 bug,你还没找到。 在他这个物理学家眼里,token 配比、数据量、数据怎么选,看着像调参,实则每一处都藏着科学假设;假设错了,你看到的不是"天花板",而是实验设计本身出了问题。

由此他得出一个和姚顺雨气质迥异的结论:在今天的大模型训练里,系统工程不是研究之外的脏活,它本身就是研究方法的一部分。 谁能更稳地识别 bug、隔离变量、约束指标、抵抗局部最优,谁就更接近真进展。这也是他那句"个人英雄主义时代过去了"的真意——路径没被发现时或许有英雄,可一旦路被打通,大模型竞争很长一段时间里更像集体主义、拼的是把复杂系统长期跑稳。他那句被疯传的"AI 本来也不太需要脑子",完整听下来说的也是一回事:这行最稀缺的品质是靠谱、做事细、对自己负责

在具体路径上,他给出两个抓手。一是 Coding:它是目前发展最快、也最现实的前沿战场,因为它同时满足了训练里两个稀缺条件——反馈信号清晰(能不能跑通、测试过没过一目了然)和数据基础天然丰富(GitHub 上几十年积累的代码)。更关键的是,coding 是"模型使用工具、与环境交互的一个绝佳抽象",把它做好,通用 Agent 能力就不远了,甚至能反过来加速模型研究本身,形成飞轮。二是 蒸馏:他把它拆成两条路——"硬蒸"(直接抄强模型的输出,又蠢又不体面)和"巧蒸"(借外部模型改造自己的训练流程)。在算力受限的当下,他甚至半开玩笑地说,中国的实验室因为擅长蒸馏,反倒可能成了"多智能体训练的先驱"——不同模型的分布各不相同,把它们放进同一个生成、筛选、评价的系统里,才是蒸馏真正有意思的地方。

四、一张表,看懂两条路线

把两人的主张摆到一起,分野一目了然。

维度姚顺雨(雨)· 腾讯混元姚顺宇(宇)· Google DeepMind
出身清华姚班 → 普林斯顿计算机博士清华基科班 → 斯坦福理论物理博士
履历OpenAI(ReAct、SWE-bench)→ 腾讯首席科学家Anthropic(Claude)→ DeepMind(Gemini)
阶段判断上半场结束,进入"下半场"上半场(预训练)远没打完
主战场Context、Agent、评估、数据预训练、Coding、蒸馏、系统工程
代表动作The Second Half、CL-bench、τ-bench大规模 RL 训练、聪明蒸馏、诊断体系
方法论像产品经理一样定义问题、Co-Design"Pre-train 也是 RL"、系统稳固 > 个人英雄
一句话"评估比训练更重要""AI 不太需要脑子,需要靠谱"
隐喻的路线应用工程 / 产品科学系统科学 / 底层能力

两个 Yao Shunyu 的核心主张对比:姚顺雨盯上层 Context 与 Agent,姚顺宇死磕底层预训练与系统工程

看这张表,很容易把两人读成"应用 vs 系统"的对立。但我认为,他们更像同一枚硬币的两面——一个从上往下问"模型会不会用上下文",一个从下往上问"怎么把能力练扎实",中间夹着的是同一样东西。

五、殊途同归:养料都是数据

有意思的是,这两条看似相反的路,最后都拐到了同一个落点——数据

姚顺雨死磕的 Context,本质是"运行时的数据":模型能不能读懂此时此刻塞进来的上下文,把它变成正确的动作。所以他到腾讯做的第一件事,是拉队伍做最脏的数据审核、建 AI Data 部、用产品回流真实数据。姚顺宇看重的 Coding,本质是"训练时的数据":GitHub 那几十年的代码,加上清晰的反馈信号,构成了一个数据充足、验证明确的训练场;而"巧蒸"更是把不同模型的输出当作新的数据来源。一个在推理侧盘活上下文,一个在训练侧榨取代码与信号,两人各挖一端,挖的却是同一口井。

两条路线殊途同归:上层的 Context 调度与底层的预训练、Coding,最终都汇入数据与系统工程这口井

这恰恰印证了我这段时间反复讲的一条主线:大模型的"预制菜时代"正在结束。 过去大家比谁的模型参数更大、跑分更高,像是从中央厨房端出一盘标准化的预制菜;而接下来无论走哪条路,真正的护城河都不在模型本身,而在你能不能把数据这门"食材功夫"做扎实——上层是可维护、对得上业务的上下文,底层是干净、可诊断、带清晰反馈的训练数据。开放式厨房的时代,比的是食材和火候,不是又买了一台更贵的灶。

结论

这场两个 Yao Shunyu 的隔空辩论,能带走几条判断:

  • "上半场 vs 下半场"其实不矛盾:姚顺宇说预训练没到头,谈的是能力的"下限还能往上抬";姚顺雨说进入下半场,谈的是价值的"上限要靠定义问题和评估来突破"。两句话说的是同一件事的两端。
  • 模型不再是护城河:CL-bench 里最强模型只解出 17.2%,说明"有个强模型"远远不够;能不能用好上下文、能不能把能力练扎实,才是分水岭。
  • 两条路都通向数据:无论上层的 Context 调度还是底层的 Coding 与蒸馏,最终拼的都是数据价值的挖掘与重塑——这是当下最被低估、也最难被替代的功夫。
  • 给从业者的读法:别急着站队"应用派"还是"系统派"。跨越"技术狂欢→产业革命"这道鸿沟,需要的正是这两股力量的交汇:既要像姚顺雨那样把上下文喂对,也要像姚顺宇那样把系统跑稳。

一句话收尾:两个念起来一样的名字,指出了两条看起来相反的路;而这两条路的尽头,写着同一个字——数据

本文部分内容由 AI 辅助生成,经人工审校和补充后发布。