Kimi K3 之后,国内 AI 的竞争逻辑变了

1 个月前11.5k
开源模型,也开始有定价权了。

据 OpenRouter 平台统计,Kimi K3 的 Token 用量在发布后增长迅猛。

K3 不仅成为首批进入 3T 参数规模的开源模型之一,更试图证明:开源模型,也可以通过顶级智能能力获得商业溢价。

K3 在编程领域的多个 benchmark 中位居前列,图片来自 Kimi 官网

它的能力底座也支撑得起这个价格:

根据 Kimi 官方测评,K3 综合能力仅次于 Claude Fable 5 和 GPT-5.6 Sol,跻身全球前三。

在 WebDev Arena 登顶编程榜第一,权重发布后当天就冲上 Hugging Face 总榜榜首。

能力外溢的冲击也不只发生在模型圈内。K3 在一次 48 小时自主运行中,仅凭开源 EDA 工具独立完成了芯片设计流程。

K3 发布当天,Cadence 重挫 9.47%、Synopsys 大跌 7.85%,费城半导体指数一周跌了 10%,美股 AI 板块三天内蒸发约 4700 亿美元。

官网展示的完整网页生成、3D 游戏搭建,以及聚集数十款游戏的 K399 平台,是同一件事的不同侧面,K3 被定位为「能交付成果」而不只是「能回答问题」的模型。

显然,智能水平外溢,抢的不仅仅是大模型友商的份额,而是会引发 AI 行业上下游甚至其他行业的连锁反应。

开源模型权重,Kimi 让渡了短期利益吗?

其实不然,一个 3T 级别的大模型,量化后约 594GB,64 张以上的 H100 组成的超节点才能跑起生产级场景,这是个人开发者承担不起的部署成本。

模型开源的红利传导,先给到芯片厂、云厂商,然后是模型推理服务商这些中间层和大 B 端,最终给到买不起大量显卡的小 B 端。

K3 权重发布当天,国内外众多基础设施厂商都迅速发布了 day0 适配公告,大模型从月之暗面独家变成了「货比三家」,B 端客户可以选更便宜的一家。

这意味着月之暗面从按量卖的「Token 经济」,站到了行业的更上游。

它不直接卖 Token, 但是可以站在上游从「云」里、从模型嵌入的产品架构和服务管线里抽水。

长远来看,月之暗面的智能溢价不会持续太长时间。

一方面,大模型中没有「常胜将军」,benchmark 随时在刷新,没有谁能全方位压倒其他模型,而且大模型也没有品牌溢价,用户总要尝鲜、换模型。

另一方面,模型越强,本身越趋商品化,渠道入口与应用场景反而成为真正的壁垒。模型更强了,芯片的需求只增不减,应用端有了更多供应商可选,两头稳赚,唯独纯模型企业被上下夹击,议价空间持续收窄。

月暗更像是在模型本身快要变得不太值钱的拐点,去争取一个布局生态、拉升估值的窗口期。而强大的技术,仍然是它给自己造血的落脚点。

2、不堆参数,K3 选择重新设计模型底层架构

大语言模型的 Scaling 可分为训练和推理两个轴。早期 Scaling 意味着在预训练阶段投入更多算力,在更大数据上训练更大模型。

但随着从零训练新模型的成本不断攀升,砸钱「烧」更大模型的速度已经放缓,推理开始成为关键的扩展维度。

月之暗面在技术报告《Kimi K3: Open Frontier Intelligence》中对技术路线作了一个推演:

当后训练技术趋于「精耕细作」,而开源模型参数持续徘徊在 1T 左右时,如果只在相似的基模上「卷」后训练技术,开源生态与最顶尖闭源系统的差距将持续扩大。

Kimi K3 的 Scaling 效率是 Kimi K2 的 2.5 倍,图片来自 K3 技术报告

K3 选择了双轴扩展,在训推两轴同时发力,K3 的 Scaling 效率是 K2 的 2.5 倍,相当于在同等损失验证水平下,K3 只需 K2 约 40% 的训练资源。

Scaling 效率的提升意味着「电费换智能」的天花板远未到顶,实质上也就抬高了模型未来价格博弈的上限。

K3 的强大,不在于它是开源生态首个 3T 级大模型,而在于它重新设计了模型的底层架构,在模型的序列长度、网络深度和模型宽度三个互补维度上发力。

Kimi K3 模型,右侧为主干网络架构图,左侧上、下分别为 MoE 模块和 KDA 模块详细示意图

首先是解决长上下文成本的 KDA(线性注意力)。

传统注意力要求每个 Token 与前序所有 Token 做点积,计算复杂度为 O(N²),序列长度翻倍则计算量翻四倍。

随着上下文扩展到百万 Token,O(N²) 的计算量和膨胀的 KV cache 成为难以承受的成本。

K3 采用线性注意力与传统注意力 3:1 的混合机制:每三层 KDA(Kimi Delta Attention)搭配一层 Gated MLA。

KDA 以线性计算降低成本,MLA 精确覆盖全局、为长程任务「兜底」。

KDA 带来三方面提升:

一是将计算复杂度降至 O(N),通过压缩历史序列信息,引入 Delta Rule(增量规则),在同一特征方向上用新信息覆盖旧信息,避免信息堆积。

二是优化芯片运行效率,KDA 让每个通道以不同速率衰减,同时设置下界以避免 BF16 精度下的数值溢出,保证稳定性。

同时,这种有界性将原本不规则的逐位置对角线计算转化为规则的密集矩阵乘法,大幅提升计算速度。

Sigmoid 衰减函数下界与矩阵密集计算优化示意图,图片来自 K3 技术报告

三是减轻内存负担,KDA 用固定大小的循环状态替代传统 KV Cache,且门控衰减本身即可提供位置信息,因此舍去了位置编码。

总体而言,KDA 以简洁优雅的方式优化了计算、通信与内存的核心瓶颈。

其次是解决深层模型信息损失的 AttnRes(注意力残差)。

上下文注意力解决的是横向、同一层内 Token 之间的关联;而 AttnRes 解决的是纵向、跨层之间的信息保真。

在普通 Transformer 中,层与层之间靠标准残差连接,每层只能拿到前一层的输出,前面各层信息被层层压缩进单一状态,必然存在损失。

K3 将注意力机制「旋转 90 度」,用在层与层之间,发明了 AttnRes(注意力残差)。

理想状态下,每层都能「回头看」,用 attention 权重挑选前面任意一层的原始输出。

为兼顾工程效率,K3 将 93 层分为 9 个块,同一块内的层输出被求和压缩成「代表向量」,也就是说模型深层翻阅的是前面每几层打包的「合订本」。

根据《Kimi K3: Open Frontier Intelligence》技术报告,这一设计以不到 2% 的额外计算成本,让模型达到了基线需 1.25 倍算力才能实现的验证损失水平,整体训练效率提升约 25%。

最后是让上百专家稳定协作的 Stable LatentMoE(路由均衡策略下的 MoE 机制)。

Quantile Balancing(分位数均衡)的工程示意图,图片来自 K3 技术报告

K3 的 MoE 架构采用 2 个共享专家(必激活)加 896 个路由专家(每 token 仅激活 16 个,稀疏度 56),在 2.8T 参数规模下实现高效推理。

极端稀疏带来两大风险:

一是数值爆炸,所以 K3 在中间插入归一化层,并将激活函数替换为有上界的 SiTU-GLU 进行软截断,既能「防爆」,又能在饱和边界外保持非零梯度,让训练更稳定。

二是负载失衡,少数「明星」专家被抢爆,部分专家长期闲置。K3 采用 Quantile Balancing(分位数均衡),先统计一批 Token 对各专家的偏好分数并排序,再按分位数直接截取,确保每位专家恰好收到目标数量的 Token。

数学理论上,这种方法每步只需一次统计和一次分位计算即可得到最优偏置,「瞬达」最优解,无需像传统方法一样渐进收敛。

这三项创新回答了一个问题:在上下文更长、层数更深、参数更多、激活更稀疏的情况下,如何让模型不仅能跑起来、跑得快,还要跑得稳。

3、后训练与自进化,从「训好一个模型」到「让模型自己变强」

大模型就像一块海绵,预训练扩展了它的毛细血管网络,而体量变大的背后,是新的底层架构在支撑,由此让智能有序、稳定的「涌现」。

但只有预训练,不足以让模型拥有像人一样解决真实世界任务的能力,而这就是后训练的目标。

为了让大模型在各行各业落地,它还需要经历「博雅教育」,并且在各种约束条件下去锻炼专精某一领域的能力。

K3 没有直接训练一个全能模型,它先在三大领域(通用任务、通用智能体、代码智能体)分别用低/高/最大三档推理预算进行强化学习,训练出 9 个领域专家。

也就是针对 3 个不同领域、3 个推理成本交叉组成的 9 种情况,分别去训练模型的最优解题能力。

之后,再通过多教师在线策略蒸馏(MOPD),把这 9 个专家的专精能力压缩进一个统一模型,调用者选择任务领域和推理预算,就会激活模型的不同推理路径。

这样做既保留了处理特定任务的专家级能力,又能按需调用、控制成本。

既然后训练要提升的是模型的「解题」能力,「题目」本身就非常重要,只有给模型喂足够多的有针对性、难度各异的任务,才能让它训练出真正的解题能力。

人类专家在这个过程中,是一个既提供支持,又严厉监督的「老师」形象。

比如,K3 的训练目标是交付端到端的复杂成果,为此,团队一方面设计了多样化的白盒智能体环境,为模型工作提供了丰富的脚手架。

另一方面,引入黑盒验证机制,这意味着只给它一个任务的输入和输出,比如,搭建一个用户点击后可以购物的网站,但完全不告诉模型怎么设计前端、后端和数据库,而是让它自主拆解任务、试错迭代。

为了让模型最后根据真实情况验证迭代,K3 还内置了黑客检测系统,专门惩罚模型为了刷分做出自我欺骗式投机行为,比如明明只是做了一个 UI Demo,却报告「我已经完全搭建好了网站」。

人类的精力是有限的,给模型大量出题的成本高昂,所以模型本身也可以自我进化。

K3 不依赖静态数据集,而是构建了一个自我扩展的层次化知识图谱,由智能体主动爬取网络上各个学科、领域的信息,然后不断下切、扩展,最终完善。

比如,从「计算机学」这个大范畴,模型会一直下切到「二进制」这样无法再细分的「原子概念」,最终搭建起一个领域的完整知识图谱。

基于图谱,模型可以自动检索真实材料并合成训练任务,实现训练数据的部分自给。

除了数据,模型还可以在后训练环境中自我迭代,包括模型本体甚至模型训练环境,比如自主优化 GPU 内核(CUDA/Triton 等)。

报告明确提到,在开发后期,K3 的早期 checkpoint(模型训练到某个阶段保留下来的参数状态,可以理解为早期保存的模型)已经可以参与团队的内核(直接在 GPU 上执行的底层计算函数程序)优化。

模型自进化,在数据、任务、模型、基础设施四层相互驱动中越训越强,所以在 K3 技术报告的贡献者名单上,Kimi K3 也赫然在列。

人类数据总有挖掘殆尽,跟不上模型训练需求增长的一天,那么模型自主合成数据和训练任务的能力就越发重要。

K3 虽然开源了模型权重,也在技术报告中开源了训练方法,却并未开源搭建训练环境、合成训练数据等核心方法。

因为相较于怎么训出某个具体模型,持续让模型进化的技术能力,才是月之暗面的核心竞争力,也是大模型商业竞争的核心机密。

Kimi K3,也列于技术报告的贡献者名单上,图片来自 K3 技术报告

4、月之暗面究竟在押注什么?

回看 Kimi K3 整体的训练过程,有一个词贯穿始终:约束。

预训练面临的约束是算力瓶颈,使得它如果想训练一个 3T 级别参数的大模型,必须要在模型的底层架构上作出创新。

因为计算、通信、存储的「不可能三角」卡在那,Kimi K3 的架构创新追求的不是做加法,而是做减法。

线性注意力舍去了繁冗的计算方法,也舍去了由此带来的膨胀内存,甚至精打细算地让数据能适配 GPU 的快速计算路径。

注意力残差把注意力机制创新地运用到了模型层与层间,只增加了约 2% 的计算成本,却提升了约 25% 的训练效率。

路由均衡策略下的 MoE 机制,将本来需要逐步迭代的均衡问题转化为「最佳优化」问题,解决了 896 个专家协作的稳定性。

后训练的约束是:复杂的真实任务、计算成本、有限的人类数据和生产力。

前两者是产品落地的核心卖点,也是用户最关心的,即怎么让每个 Token 都能在特定任务下发挥出更高的智能生产力;后者是模型持续 Scaling 的瓶颈之一,对此,月之暗面正在探索自进化的解法。

地缘竞争造成资源瓶颈,商业世界也要求价值自证,这些外在约束影响了月之暗面的技术发展和产品规划,但在克服这些束缚之外,它究竟在押注一条什么样的未来之路?

Kimi K3 开源权重后不久,DeepSeek-V4-Flash 正式版、MiniMax H3 也分别于 7 月底和 8 月 3 日开源。

它们的市场反响也不比 Kimi K3 弱,DeepSeek 依靠 V4-Flash 极致的性价比,在全球开发者市场中划出了一条「斩杀线」,MiniMax 则凭借多模态视频模型 H3,迅速登顶开源社区榜首并扩散到上下游生态中。

开源市场的热闹,印证了一个趋势:在模型的高阶智能能力尚属稀缺的时候,许多模型厂商基于稀缺性带来的定价权,选择了开源或闭源。

但是当市场水涨船高,模型一时的刷榜和热度反而没那么重要了。

未来 AI 竞争,不是单纯比模型,而是比拼综合能力,模型能力只是牌桌上的入场券,重要的还有应用场景、商业收入、用户反馈、数据闭环的一整个生态。

持续地造出更高智能的模型,需要高质量数据供给和工程创新,这里面只有包含用户反馈,并且让模型能自进化,才是完整的闭环。

造模型也需要不断的现金流,所以应用落地和底层创新同样重要。

杨植麟曾经在媒体采访时表达过,希望月之暗面成为一家像字节跳动那样既重视技术又重视商业化、关心用户的公司。

月之暗面选择铺开生态,用强大的智能水平促进商业化,商业化再反哺支持底层技术创新。

在大模型竞争日益激烈的今天,技术不会一直领先,但生态会越来越重要。

Kimi K3 的亮相够分量,而国产开源生态的新时代才刚刚开始。


格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

AI芯片成本拐点?ASML与台积电联手降本

茶山 · 1小时前

cover_pic

CPO/光模块设备:三大价值量环节及供应商梳理

伏白的 交易笔记 · 1小时前

cover_pic

江波龙H股上市在即,六年诉讼同步和解

洞察IPO · 3小时前

cover_pic
我也说两句