开源权重的收租条款:Kimi K3 把闸门装在了谁头上

7 月 26 日,月之暗面(Moonshot AI)比自己承诺的日期提前一天放出了 Kimi K3 的完整权重。同时上线的还有一份 47 页技术报告、优化过的注意力算子、MoE 通信库,以及 vLLM 和 SGLang 的适配。按任何标准衡量,这都是一次诚意很足的发布。
但接下来两天,社区吵得最凶的不是那 47 页报告,而是仓库根目录下一个 3.07 KB 的文本文件:LICENSE。
原因很简单。K2 系列一直用的是一份 Modified MIT——MIT 原文一字不动,末尾加一句:如果你的商业产品月活超过 1 亿或月收入超过 2000 万美元,得在界面上显著标注 "Kimi K2.6"。仅此而已,一条署名义务。几乎所有报道在 K3 权重发布前都默认它会沿用这个模式,包括不少写了详细指南的技术媒体。
结果 K3 换了一份自己写的许可证。新增的那一条,不再要求你署名,而是要求你先来谈钱。
在往下讲之前,先把一个贯穿全文的词说清楚:开放权重(open weights)。所谓权重,就是模型训练完之后得到的那一大堆参数数值——K3 是 2.8 万亿个——模型的全部能力都存在这些数字里,所以拿到权重基本等于拿到了这个模型本身。开放权重,就是把这堆参数打包公开,任何人都能下载、自己跑、拿去微调。
它和开源不是一回事,而这个区别正是本文要谈的全部。按软件世界的惯例,开源除了给你成品,还要给出构建它的条件——训练数据、训练代码、完整配方——并且许可证不附加商业限制。K3 给了权重、推理代码、注意力算子、MoE 通信库和 47 页技术报告,唯独没给训练数据,也没给一份无条件的授权。所以它是 open weight,不是 open source。这两个词在中文里经常被混着叫「开源模型」,而 K3 这次恰恰把混叫的代价摆到了台面上。
我想讲清楚的判断是:这一条不是「开源做得不彻底」,而是一次设计相当精密的商业结构。它对使用者几乎完全放行,把收费闸门单独架在「转卖推理能力」这一层上。而 2.8 万亿参数带来的部署门槛,恰好保证了能行使自托管权利的,主要就是被这道闸门卡住的那批公司。开放的是权重,收费的是转售。
一、多出来的那一条
先把两份许可证摆在一起看。这是理解整件事最快的路径。
K2.6 的许可证正文就是标准 MIT,唯一的自定义部分只有结尾一段:
Our only modification part is that, if the Software (or any derivative works thereof) is used for any of your commercial products or services that have more than 100 million monthly active users, or more than 20 million US dollars in monthly revenue, you shall prominently display "Kimi K2.6" on the user interface of such product or service.
译文:我们唯一修改的部分是——如果本软件(或其任何衍生作品)被用于你的任何商业产品或服务,且该产品或服务月活跃用户超过 1 亿,或月收入超过 2000 万美元,你应当在该产品或服务的用户界面上显著标注 "Kimi K2.6"。
K3 的许可证把这段保留了下来(成为第 3 条),但在它前面插进了一条全新的第 2 条:
"Model as a Service" means giving a third party access to language model inference or fine-tuning (e.g., via API) in a manner that allows such third party to exercise meaningful control over the inputs, parameters, or training data.
If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 20 million US dollars ... in total over any consecutive 12 months, the Licensee must enter into a separate agreement with Moonshot AI before using the Software or its derivative works for any commercial purpose.
译文:「模型即服务」指以某种方式(例如通过 API)向第三方提供语言模型推理或微调能力,使该第三方得以对输入、参数或训练数据行使实质性控制。
如果被许可方或其任何关联方经营模型即服务业务,且被许可方与其关联方在任意连续 12 个月内的合计收入超过 2000 万美元(或等值的其他货币),则被许可方在将本软件或其衍生作品用于任何商业目的之前,必须与月之暗面另行签订协议。
两条的性质完全不同。署名是事后义务——你先用,做大了记得标注。而单独协议是事前门槛——够条件的公司,在商用之前就得先坐下来谈。
| 维度 | K2.6(Modified MIT) | K3(Kimi K3 License) |
|---|---|---|
| 许可证基底 | MIT 原文 + 一段附加 | 自行起草,MIT 风格但独立成文 |
| 署名义务 | 月活 > 1 亿 或 月收入 > 2000 万美元 | 保留,条款不变(第 3 条) |
| 商用前置审批 | 无 | 有:MaaS 业务 + 集团 12 个月合计收入 > 2000 万美元(第 2 条) |
| 触发口径 | 单个产品的规模 | 主体及其关联方的总收入,不限于 K3 相关业务 |
| 豁免出口 | 无需要 | 内部使用;经官方产品或认证推理伙伴接入(第 4 条) |
| 前 AI2 研究员 Nathan Lambert 的定性 | —— | "inspired by MIT but distinctly non-commercial" |
有一个细节值得单独拎出来。第 2 条计算的收入门槛,写的是"被许可方及其关联方的合计收入",并没有限定这笔收入必须来自 K3 相关业务。也就是说,一家自身规模不大、但隶属于某个年收入过 2000 万美元集团的小团队,只要它做的事落进 MaaS 定义,同样得去谈协议。这个口径比 Llama 社区许可那个"月活 7 亿"的阈值苛刻得多——后者只在你真的做到超级规模时才生效,而前者对绝大多数有母公司的商业团队都是活的。
二、这道闸门到底拦谁
条款的精确之处,在 MaaS 的定义里。它明确排除了两类情形:(a) 模型能力仅嵌入在具体功能或 harness 里的终端产品;(b) 单纯把请求转发给别人托管的模型。
把这三句话拆开对照实际角色,边界其实非常清楚。
| 你在做什么 | 是否算 MaaS | 说明 |
|---|---|---|
| 内部研发助手、员工问答、文档处理 | 否 | 第 4 条 (a) 明确豁免,不对外提供即可 |
| 银行 / 品牌方的客服机器人、业务 Agent | 否 | 能力嵌在具体功能里,不给第三方控制权 |
| SaaS 产品内置 AI 副驾 | 否 | 同上,用户控制的是产品功能不是模型 |
| 中转站、聚合路由(转发给别人托管的模型) | 否 | 第 2 条 (b) 明确排除"mere relaying" |
| 自己起集群、对外卖 K3 推理 API | 是 | 第三方对输入、参数拥有实质控制权 |
| 提供 K3 微调服务 / 模型训练平台 | 是 | 定义里 fine-tuning 与 inference 并列 |
于是画面就清楚了:绝大多数企业和开发者不受影响,甚至可以放心把 K3 塞进商业产品;真正被卡住的,是云厂商和推理服务商——那些把开放权重当作商品来托管转售的一层。而这一层,恰恰是一个前沿模型开放权重之后,商业价值最容易被别人拿走的地方。
第 4 条 (b) 又补了一句:通过月之暗面官方产品或其"认证推理伙伴"接入的用法,不受第 2、3 条约束。这句话把闭环合上了。想合规地卖 K3 推理,你有两条路:要么单独签协议,要么成为认证伙伴。无论走哪条,发牌的人都是月之暗面。
这套结构的效果,是把一个开放权重模型改造成了 freemium:研究免费,企业自用免费,做产品免费,唯独"靠转卖它的推理赚钱"这件事,需要付费准入。

三、开放的是权重,不是可及性
许可证之外还有第二道门,而且这道门是物理的。
K3 是稀疏 MoE 架构,2.8 万亿总参数,从 896 个专家里激活 16 个,官方口径下每次前向激活约 1040 亿参数。权重采用 MXFP4 格式、激活用 MXFP8,从 SFT 阶段开始就做量化感知训练——已经是为了省显存做过优化的方案。即便如此,按参数量与 4 bit 精度直接估算,原始权重体积约 1.4 TB(VentureBeat 报道的实测口径约 1.5 TB),这还没算量化元数据、运行时缓冲、激活值、路由状态,以及百万 token 上下文的 KV 缓存。
月之暗面自己给的部署建议是:超节点配置,64 卡以上(官方原文写的是 accelerator,涵盖 GPU、NPU 等各类加速芯片形态)。官方没有公布最低可行配置,但给出这个数字的理由写得很直白——896 个专家的分发和每 token 路由 16 个专家,对设备间通信带宽的要求是第一位的。
这意味着"你可以自己跑"对绝大多数人来说是一项理论权利。社区确实出现了用消费级 RTX 5090 集群跑起来的报告,但那和生产级的吞吐、延迟完全是两回事。真正能把 64 卡超节点常态化跑起来、并且有动机这么做的,是谁?是云厂商和推理服务商。
所以两道门是咬合的:能实际行使自托管权利的那批主体,与被第 2 条要求先谈协议的那批主体,高度重合。 对个人开发者和中小企业,第 2 条形同虚设,因为他们本来也跑不动;对跑得动的人,权重开放的商业收益被条款截住了。这不是巧合,这是把技术门槛和法律门槛叠在同一个位置。

四、凭什么敢这么写
一份收租条款能不能立住,取决于东西够不够硬。K3 的底气来自两组数字:能力站得住,价格打得下去。
先看能力。需要说明的是,月之暗面自己的评测表在不同模型上用了不同的 agent harness(Kimi Code、Claude Code、Codex 混用),所以更适合当方向性证据看。下面这组来自第三方,口径相对一致:
| 独立评测 | K3 成绩 | 位次 | 备注 |
|---|---|---|---|
| Artificial Analysis 智能指数 v4.1 | 57 | 189 个模型中第 4 | 落后 Claude Fable 5 与两档 GPT-5.6 Sol 推理设置 |
| Vals Index | 74.70% | 38 个中第 2 | 最大推理强度下评测 |
| Vals Terminal-Bench 2.1 | 80.90% | 第 2 | 三次完整试验平均 |
| Arena WebDev | 1679 | 第 1(初步) | 1757 票,样本仍小,会变动 |
| AA 输出速度 / 首 token 延迟 | 62 tok/s / 1.99 s | —— | 测的是官方托管 API,非自托管 |
再看价格。官方 API 定价为缓存命中输入 0.30 美元、未命中输入 3 美元、输出 15 美元(每百万 token),靠 Mooncake 分离式推理架构在编码类负载上把缓存命中率做到了 90% 以上。Artificial Analysis 按"完成一个加权任务的实际花费"折算的结果更能说明问题:
| 模型 | 每个加权任务成本 | 相对 K3 |
|---|---|---|
| GLM-5.2 | $0.47 | 0.5× |
| Kimi K3 | $0.94 | 1× |
| GPT-5.6 Sol(max) | $1.04 | 1.1× |
| Claude Fable 5(含 fallback) | $2.75 | 2.9× |
一个排在第 4 的模型,把每任务成本压到了榜首模型的三分之一。这就是那句"闭源厂商很难再单靠能力来支撑溢价"的实际含义。
顺带一提,架构上真正起作用的两块——Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)——都不是这次才有的东西。AttnRes 那套"让残差连接长出注意力"的思路,我在 3 月写《AttnRes:让残差连接"长出注意力"》时还只是一篇论文里的架构改进,当时官方给的说法是同等算力下约 25% 的提升。四个月后,它成了一个 2.8 万亿参数模型的骨干,月之暗面声称配合 Stable LatentMoE 后整体 scaling 效率相比 K2 提升约 2.5 倍。从纸面架构到撑起 3T 级模型,这条路走了四个月。
一个具体的能力样本:让模型给自己设计芯片
抽象的分数容易失焦,月之暗面放的这个案例更能说明"长程自主"到了什么程度。
| 指标 | 结果 |
|---|---|
| 任务 | 为一个基于 K3 自身架构的 nano 模型设计专用芯片 |
| 运行方式 | 单次 48 小时自主运行,使用开源 EDA 工具链 |
| 工艺库 | Nangate 45nm |
| 面积 / 时序 | 4 mm²,100 MHz 下时序收敛 |
| 仿真吞吐 | 解码 8700+ tokens/s |
| 规模 | 146 万标准单元、0.277 MB SRAM、带融合反量化的 INT4 MAC 阵列 |
整件事的完整链条是:模型自己完成构建、优化和验证,全程无人接管 48 小时。同一批案例里还有一个类似量级的:复现计算天体物理里的 I–Love–Q 普适关系,K3 交叉验证 20 多篇论文、评估 300 多个物态方程、写出 3000 多行 Python,约两小时完成——按月之暗面的说法,这通常是一位有经验的研究者一到两周的工作量。
这些案例的共同点不是"更聪明",而是能在没人盯着的情况下连续跑很久而不散架。而这恰恰是最需要按量消耗 token 的使用方式——一个 48 小时的自主任务,烧掉的 token 是一次对话的几个数量级以上。当模型的主要价值转移到长程自主执行上,谁收这笔推理费,就成了必须锁死的问题。第 2 条要护的就是这个。
不过月之暗面自己也列了三条限制,写得相当坦率,值得照抄给任何准备接入的人:K3 训练时保留了完整思考历史,如果 harness 没把历史思考内容原样回传,或者会话中途从别的模型切过来,生成质量会剧烈不稳定;模型"过度主动",遇到含糊指令时容易替用户擅自做决定,需要在 system prompt 或 AGENTS.md 里显式约束边界;以及整体用户体验仍落后于 Fable 5 和 GPT-5.6 Sol。另外 Artificial Analysis 实测它在整套评测里输出了 1.3 亿 token,约为同价位推理模型中位数的两倍——话多,也是成本。
五、放到更大的棋盘上
许可证这件事之所以不只是法务话题,是因为它落在一个正在变化的地缘格局里。
7 月 23 日,APEC 数字周在成都召开,21 个成员经济体(包括美国)共同表态支持"带强安全保障的开源 AI"。Counterpoint Research 的 AI 首席分析师 Wei Sun 对此的评价很直接:这种背书"让中国的开放权重路线在区域内获得了更大的合法性,在部署成本和技术主权都是主要考量的新兴亚洲经济体尤其如此"。
对照之下美方的动作显得安静。CNBC 记者在现场统计,7 月 23 日设展位的美国公司只有 Google 和 Meta 两家,而且展示的分别是分子 AI 系统和面向小企业的应用,都不是大语言模型;Google 政府事务副总裁在 24 日的演讲里只顺带提了一句 Gemini。Politico 援引三位前官员称,美国 AI 出口计划迄今只收到 78 份申请,低于预期——商务部国际贸易管理局发言人则回应说申请量"超出了我们的预期"。
但把这理解成"中国便宜模型赢了"就太糙了。CNBC 那篇报道里最有信息量的其实是另一段:东南亚有 1300 多种在用语言,各国政府正在为适配本地语言的 AI 系统花掉数十亿美元。一家叫 Votee AI 的初创公司 CEO 说,他们在和至少五个政府合作、年收入已超千万美元,而他们那个面向粤语使用者的开源模型,部分是基于 Qwen 开发的。同一批客户在训练时倾向用 Nvidia 芯片,跑推理时则可能换别的。
这才是真实形态:不是二选一的阵营划分,而是混装。底座可能是中国的开放权重,芯片可能是美国的,最终产品是本地团队做的。而在这种混装格局里,最有价值的位置不是"谁的模型更强",而是谁的权重被拿去当底座——因为底座决定了后面所有微调、蒸馏、二次开发的路径依赖。
从这个角度回看第 2 条,它想守住的东西就更清楚了:月之暗面要的是尽可能多的人把 K3 当底座(所以对使用者极度宽松),同时不让别人靠转卖这个底座的推理赚走钱(所以对 MaaS 收紧)。 传播要最大化,变现要收口。这两个目标本来是冲突的,而这份许可证试图同时拿到。
六、你该怎么判断
如果你正在评估要不要用,顺序应该是先看你打算怎么用,再看跑分。分三种情况:
只在内部用。 员工助手、代码检索、文档处理、研发工具——第 4 条 (a) 的豁免写得很宽,只要不把模型、输出或底层能力提供给第三方,第 2、3 条都不适用。这是限制最少的一档,可以直接按技术标准评估。
做面向客户的产品。 需要先做一次定性:你的用法算不算 MaaS。判断标准是第三方对输入、参数或训练数据是否拥有实质控制权。做客服机器人、业务 Agent、产品内 AI 功能,通常都不算;一旦你开始对外暴露可自由调参的推理接口或微调能力,就算。同时要算清集团口径的收入,以及未来是否可能触发 2000 万美元的门槛——这件事该在架构定型前问,不是上线后问。
规划超大规模。 月活过亿或月收入过 2000 万美元的产品,还要考虑第 3 条的署名义务。对习惯于把底层模型抽象掉、不对外披露供应商的软件厂商,这条的实际影响可能比收入门槛更麻烦,它会直接影响品牌呈现和白标合同。
至于自托管,判断很简单:如果你没有 64 卡量级的超节点和配套的分布式推理运维能力,"开放权重"对你的实际意义主要是议价筹码和退出选项,而不是马上就能落地的部署方案。这个筹码本身有价值——它让你在和闭源厂商谈价时手里有牌——但别把它当成已经到手的能力。
结论
四条,供带走:
K3 的许可证是一次商业模式设计,不是开源程度打折。 它对研究者、企业内用、产品集成几乎完全放行,只在"对外转卖推理与微调能力"这一层设了收费闸门,并通过"认证推理伙伴"把发牌权收在自己手里。
"开源"这个词在前沿模型上已经不够用了,必须拆成两层看。 权重是否可下载是一回事,商业条件是什么是另一回事。往后评估任何开放模型,读许可证要和读跑分放在同等位置——这句话四个月前还是老生常谈,现在是实打实的采购风险。
技术门槛和法律门槛正在叠到同一个位置。 1.4 TB 权重和 64 卡起步的部署建议,让能行使自托管权利的主体,与被条款要求先谈协议的主体高度重合。评估"我能不能自己跑"时,要同时算这两笔账。
竞争焦点从"开放还是封闭"转向了"在什么条件下可以商业化"。 当前沿能力以可下载权重的形式扩散,能力差距会被价格拉平,剩下的分野在合同里。每任务 0.94 美元对 2.75 美元的差价是真的,但它换来的不是无条件的自由。
最后留一个问题。这份许可证的逻辑是"用开放换扩散,用条款守变现",而它成立的前提是闸门装得准——刚好卡住转售者,不误伤使用者。可 MaaS 的边界并不像条文读起来那么锐利:一个把模型能力做成可配置工作流、允许客户自带 prompt 和参数的 Agent 平台,到底算不算"让第三方对输入和参数拥有实质控制权"?
如果你的产品正好卡在这条线上,你会怎么判?
参考资料
- 月之暗面(Moonshot AI),《Kimi K3: Open Frontier Intelligence》,2026 年 7 月 16 日。https://www.kimi.com/blog/kimi-k3
- 月之暗面,《Kimi K3 License》,Hugging Face 仓库,2026 年 7 月 26 日提交。https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
- 月之暗面,《Modified MIT License》(Kimi K2.6),Hugging Face 仓库。https://huggingface.co/moonshotai/Kimi-K2.6/blob/main/LICENSE
- Carl Franzen,VentureBeat,《Kimi K3's full weights are here, but they're 'open' with a caveat: What enterprises should know》,2026 年 7 月 27 日。https://venturebeat.com/technology/kimi-k3s-full-weights-are-here-but-theyre-open-with-a-caveat-what-enterprises-should-know
- Cristina Bunea,Northflank,《Kimi K3: benchmarks, pricing, hardware requirements, and self-hosting》,2026 年 7 月 16 日(7 月 17 日核验)。https://northflank.com/blog/what-is-kimi-k3-self-hosting
- Leonardo Gonzalez,Trilogy AI Center of Excellence,《Kimi K3 Is Live: Pricing, Benchmarks, and the Wait for Open Source》,2026 年 7 月 16 日。https://trilogyai.substack.com/p/kimi-k3-is-live-pricing-benchmarks
- Evelyn Cheng,CNBC,《The U.S. wants Asia to use its AI — but China dominates cheaper models》,2026 年 7 月 30 日。https://www.cnbc.com/2026/07/30/us-wants-asia-to-use-its-ai-but-china-dominates-cheaper-models.html
- Reuters,《China's Moonshot unveils world's largest open AI model, closing in on US rivals》,2026 年 7 月 17 日。https://www.reuters.com/world/china/chinas-moonshot-unveils-worlds-largest-open-ai-model-closing-us-rivals-2026-07-17/
- Artificial Analysis,Kimi K3 模型评测页。https://artificialanalysis.ai/models/kimi-k3
- ICE 数字实验室,《AttnRes:让残差连接"长出注意力",Kimi 如何给 Transformer 提效 25%》,2026 年 3 月 20 日。