他把 2.8 万亿参数白送出去,却在许可证里留了一道闸——杨植麟,和他为什么还不在这份榜单上
7 月 27 日,月之暗面把 Kimi K3 的完整权重传到了 Hugging Face 上。
1.42 TiB,96 个分片。2.8 万亿总参数、1040 亿激活参数、100 万 token 上下文。 93 层里有 69 层用自研的 Kimi Delta Attention,896 个路由专家、每个 token 选 16 个,外加 2 个共享专家。
这是目前世界上最大的开放权重模型。你可以整个搬回家。
7 月 16 日 K3 先以服务形式上线,11 天后权重白送。这 11 天里它在 GPQA Diamond 拿到 93.5,DeepSWE 67.5,BrowseComp 91.2,MCPMark-Verified 94.5。
参数和分数已经被转了一整天。同一批材料里还有三件事没什么人提,都是产品决策。
一、真正的设计不在模型里,在许可证里
大家都说”Kimi K3 开源了”。它不是 MIT。
月之暗面自己定了一份 Kimi K3 License,主体确实像 MIT——你可以随便用、复制、改、分发、再授权、拿去卖,可以部署、可以微调、可以拿它做衍生模型。
然后有两条例外:
第一条,卖服务要回来谈。 如果你把它做成模型即服务(MaaS)——让第三方能对输入、参数或训练数据有实质控制——而你这家公司在任意连续 12 个月里营收超过 2000 万美元,你必须跟月之暗面单独签一份协议。
第二条,做大了要挂名。 商业产品如果月活超过 1 亿、或者月营收超过 2000 万美元,必须在界面显著位置标出 “Kimi K3”。
豁免:纯内部自用不受限;走月之暗面自己的产品或认证推理伙伴,也不受限。
把这三段连起来读,这份许可证的形状就出来了:
小的随便用,用到能赚大钱那一天,要么回来分钱,要么替我打广告。
我做产品这些年,见过的开源策略基本是两个极端:要么真的完全放开(然后看着云厂商拿去赚钱、自己一分拿不到),要么开一个阉割版(然后没人愿意基于它做东西)。
这份许可证是第三条路,而且切口切得非常准。 它把闸门设在”你已经赚到钱了”这个点上——在此之前,摩擦为零,个人开发者、创业公司、研究者随便搬;越过这条线的,本来就有钱付,也付得起。
注意第二条那个”必须显著标出 Kimi K3”。 这一条不收钱,收的是别的东西——它让每一个跑在 K3 上的大产品,都变成月之暗面的招牌。开源换生态、生态换品牌、品牌换议价权,这条链在许可证里被写成了法律条文。
对做产品的人,这里有一个可以直接抄的思路:当你要靠”免费”换规模时,先想清楚”从哪一刻开始不免费”,并且把这一刻写成一条别人能自己判断的、清清楚楚的线。 模糊的免费政策,最后一定变成一地扯皮。
顺序也是设计过的。 7 月 16 日 K3 先以托管服务上线,11 天后才放权重。这 11 天里,评测跑完了、口碑起来了、日营收涨了 6 倍——放权重的时候,它已经不是一个待验证的模型,而是一个被证明过的模型。
反过来做会怎样:权重和服务同一天出,所有人第一时间自己部署,你既拿不到那 11 天的收入,也拿不到那批最早的真实使用数据。开源不是不要钱,是先把钱和数据收在前面,再把代码放出去。
二、刚拿了第一,就在发布材料里说自己不如对手
这一条更少见。
在自己的发布材料里,月之暗面自认 K3 整体性能仍落后于 Claude Fable 5 和 GPT-5.6 Sol,并指出用户体验存在差距。
不止如此。他们还主动说明:不同模型在评测时用了不同的 agent harness——也就是说,跑分环境不完全可比,评测结论有不确定性。
刚做出世界上最大的开放权重模型、在多项硬评测上登顶,全球都在看它的那一刻,它在自己的发布稿里主动说了两件对自己不利的话:体验还不如人家;这个分数的比法本身有水分。
昨天特斯拉 Q2 电话会上是相反的一幕。马斯克说现在网上爆红的人形机器人演示”大多是远程操控或者按事先安排的脚本完成的”,真正能自主执行通用任务的还没出现,Optimus 会是第一个——而同一周被梳理出来的报道里,2024 年华纳兄弟那场活动上倒酒的 Optimus,是工程师穿着动捕服、戴 VR 头显操作的;帕洛阿托总部里机器人摔倒之后还要用吊装设备扶起来。
同一周,一个说”别人的都是遥控和剧本”,一个说”我们体验还不如对手”。
两种打法各有各的道理。马斯克那套预期管理,为特斯拉换来过真金白银的时间;月之暗面这套坦白,也可能只是因为它面对的是开发者,而开发者一天之内就能自己跑出真相——在这个受众面前吹牛,成本高过收益。
但对产品经理来说,能带走的东西是一样的:你说的每一句话,用户是按今天的产品来验的。 区别只在于,你的用户多久能验出来。用户验得越快,诚实就越划算。
而开发者,是验得最快的那一类用户。
三、便宜三倍,不等于省三倍
价格这一条被转得最多,也最容易读错。
K3 的国际定价是输入每百万 token 3 美元、输出 15 美元。对照 Claude Fable 5 的输入 10 美元、输出 50 美元——纸面上便宜三倍多。中国区是缓存输入 2 元、未缓存 20 元、输出 100 元。
然后是那个被淹没在通稿里的细节:
多名测试者反映,完成同样的任务,K3 消耗的 token 比 Fable 更多。
这一句把前面那个”便宜三倍”打了个折。单价不是成本。你要付的是”完成一件事的总花费”,等于单价乘以完成它需要的 token 数。
这是一个非常典型的产品陷阱,而且不只出现在 AI 里:你优化了一个用户看得见的数字,代价藏在另一个用户算不清的数字里。
我自己踩过同类的坑。做发布流水线的时候我盯着”单个平台发布耗时”优化,把每一步都压短,结果整体反而更慢——因为压短的那些步骤触发了平台的反自动化,重试次数上去了。局部指标好看了,端到端变差了。
所以如果你正在评估要不要换到 K3,别看官网价目表,拿你自己真实的任务跑一遍,算完成一次的总账。 这个数可能仍然是 K3 划算——它便宜的幅度够大——但那应该是你算出来的,不是它标出来的。
需求是真的:K3 上线之后,月之暗面的日营收至少涨了 6 倍;6 月 ARR 到了 3 亿美元,4 月还是 2 亿。
四、他是谁
杨植麟,1992 年生,广东汕头人,高考是汕头理科状元。 清华本科,大二转进姚班,2015 年以年级第一毕业。然后去卡内基梅隆读博,导师是苹果首任 AI 总监 Ruslan Salakhutdinov 和 Google 的 William W. Cohen。
Transformer-XL 和 XLNet 两篇论文,他都是第一作者。 XLNet 当年在 20 个任务上超过 BERT、18 个任务上刷到最好成绩。他是中国 35 岁以下 NLP 领域引用最高的研究者之一。
还有一件跟技术无关但我觉得挺重要的事:他在清华组过一支摇滚乐队叫 Splay,自己是主唱兼作词。
2023 年 3 月,他和周昕宇、吴育昕创立月之暗面。2024 年 2 月阿里领投 10 亿美元,8 月腾讯和高榕又投了 3 亿。
许可证那道闸、发布稿里的坦白、定价的取舍,这三条都不是研究员思维。研究员的默认动作是把分数刷到最高然后发论文。在许可证里精确地设一道商业闸门、在最风光的时刻主动说自己不如对手,这些是产品和商业判断。
一个 XLNet 的第一作者同时在干这两件事,比”论文很强的技术人”这个标签复杂得多。
五、那他为什么还不在这份榜单上
我维护着一份《改变世界的 100 个产品经理》榜单,六个维度打分——远见、洞察、品味、商业、规模、开创——加权得出 OVR。杨植麟不在上面。
规则是这样的:这份榜只有 99 个条目,第 100 位刻意留白,留给读者。 要放一个人进去,就必须把另一个人拿下来。
为了追今天的热点把某个人从榜上挤掉,那样做出来的榜追的是新闻周期,不是产品史。 所以这篇不挂榜。
不挂榜不等于配不上,标准得说明白。
同一档里已经在榜的是梁文锋,OVR 91(远见 95 / 洞察 84 / 品味 86 / 商业 88 / 规模 92 / 开创 95)。DeepSeek 那一次是改变了整个行业成本结构的事件——它把”前沿模型必须很贵”这个共识打掉了,全球的定价和开源策略都跟着动。
拿同一把尺子量杨植麟,我的判断是:远见和开创已经够进榜,规模和商业还差一口气。
- 开创:把 2.8 万亿参数的模型做成开放权重,这是没人做过的事;那份带营收阈值的许可证也是新东西,很可能会被别人抄。
- 远见:从 Kimi 早期押长上下文,到今天押”开放权重 + 商业闸门”,方向一直很清楚。
- 规模:ARR 3 亿美元、日营收涨 6 倍,增长很猛——但这是几个月的数字,还不是一个跨越周期的体量。榜上那些人的规模维度,量的是”影响了多少人、多少年”。
- 商业:那道许可证闸门设计得漂亮,但还没有被验证过。有多少家营收过 2000 万美元的公司真的会回来签协议,一年后才知道。
说白了:他的分数里,最值钱的那部分是”正在发生”,而不是”已经兑现”。
榜单和新闻的区别就在这。新闻记录正在发生的事,榜单记录已经落定的事。今天把他放进去,是我在替一年后的结果下注,而不是在陈述事实。
但这份榜是活的。 张小龙、乔布斯这些人的位置大概不会动,中间和后段一直在变——Linus 加回来的时候,就换掉了威尔·赖特。我打算在下半年重新排一次全榜,到时候 K3 的开放权重生态到底长出了什么、那道商业闸门到底收上来多少、月之暗面熬没熬过白宫那关,都会是明摆着的事实。
如果那时候这些都兑现了,他进榜就不是下注,是记录。
白宫那一关也还悬着。K3 权重放出来之后,白宫 CTO Michael Kratsios 公开指控月之暗面蒸馏了 Anthropic 的 Fable 5,说要区分正常的 AI 蒸馏和”大规模、隐蔽的、旨在窃取美国专有技术的工业级蒸馏”;财政部长 Scott Bessent 表示政府”有能力实施制裁”。
一个开源模型能把一个国家的 CTO 和财长同时引出来说话,分量已经在那儿了。 但这条线怎么走,直接决定这家公司明年的规模维度能打多少分。
最后
“免费”从来不是一个决定,“从哪一刻开始不免费”才是。 大多数人做开源、做免费增值、做试用期,都只想清楚了前半句,在后半句上含糊过去——结果要么该收钱的时候收不上来,要么在错误的时刻竖起收费墙,把生态吓跑。
杨植麟把这条线写死在了许可证里:2000 万美元营收,1 亿月活。 谁越线谁自己知道,不用谈判,不用扯皮。
我做 SoloMD 的时候没想这么细。它现在是免费的,MIT 开源,551 个 star,21 个外部 PR——生态是有了,可要是哪天有人拿它做成一门生意,我手上没有任何一条线可以指给他看。
(本文所有评分与排序由 Claude(AI)完成,方法说明见榜单页。杨植麟的评价为本文分析,未计入榜单。)
讨论