Kimi K3产业链拆解,国产AI的“系统闭环”已经跑通

16 小时前6.0k
Kimi K3验证国产AI产业链,一条不依赖CUDA的平行体系已成型。

产联社 2.png

7月16日,月之暗面正式发布K3,总参数2.8万亿,全球最大开源大模型,Arena编程能力全球第一。马斯克在X上只发了一句话:"Kimi K3令人印象深刻。"

真正值得关注的不是排名,而是K3验证了一件事:国产AI的"系统闭环",已经跑通了。从昇腾芯片、国产服务器到800G光模块,从编译器到全球开发者工具,一条不依赖英伟达CUDA的平行体系,第一次被2.8万亿参数的大模型完整打通。

它定价15美元/百万Token,国产最贵,却仅为海外顶尖模型的三分之一。这种底气,来自国产供应链的成本重构。

这不是参数竞赛,是一场从算力基建到应用入口的产业链系统性重构。

111.png

来源:Arena. AI(K3登顶全球编程能力第一,超越Claude与GPT)

K3不是堆参数:1.79%激活率跑通了2.8万亿

很多人对2.8万亿参数没有概念。业界早有共识:单纯堆参数,模型训练会面临loss spike(损失值暴涨)的稳定性灾难,推理成本也会高到无法商用。K3的解法是一套"精算师思维",即让2.8万亿参数"沉睡",只在需要时唤醒极少数。

据月之暗面官方介绍,K3采用了896选16的超稀疏MoE(混合专家)架构,每次推理仅激活16个专家,激活比例仅1.79%。这就像一个大型医院的会诊系统:全院有896个科室的专家,但针对你的具体病症,系统只请16个最相关的科室主任来会诊。既保证了诊断水平的上限,又避免了"全院加班"的巨额成本。

与此同时,中金公司指出,K3自研了KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)。如果把传统注意力机制比作一个人读长文时"看了后面忘前面",KDA就像给模型装了一个"速记本",让100万Token(约150万字)的上下文真正实现无损长程记忆。经其测算,K3的扩展效率较上一代K2提升了约2.5倍。

原生视觉理解是另一张底牌。K3不是简单地把图片"翻译"成文字再处理,而是从架构层面实现了视觉与文本的联合理解。这意味着它可以直接看懂设计稿、工程图纸、前端界面截图,并生成对应代码。这也是它在编程评测中登顶的技术根基。

开源≠自部署:国产超节点才是红利落点

K3开源了,但普通企业很难"抱回家"。据产业链调研,K3的部署门槛极高,通常需64卡以上超节点支撑,训练环节更需数万卡集群连续运转数月。

所谓超节点,是由64到1024张国产加速卡通过高速互联组成的大算力单元,具备统一调度、共享内存、低延迟通信能力。K3的出现,正在加速国产算力从"可用"到"好用"的替代进程。

在芯片层,昇腾910B是目前与K3适配最成熟的国产方案。华为Atlas 950 SuperPoD(1024张昇腾910B)已成为官方推荐的首选国产算力底座,完成了K3全链路适配。海光DCU3凭借兼容CUDA生态的优势,在推理场景快速切入;寒武纪思元590则针对MoE架构的稀疏计算做了专门优化。

在服务器层,浪潮信息作为Kimi训练集群的核心供应商,推出了NF5488A6超节点,单台可支持64张国产加速卡;中科曙光的"曙光8000"十万卡超集群,则瞄准了更大规模的训练需求。

但真正的瓶颈在"连接"而非"计算"。MoE模型每轮推理都要在数百个专家之间做海量数据交换,通信量是同规模稠密模型的数倍。机架之间、机房之间需要800G甚至1.6T的高速光模块来传输数据。目前800G光模块已大规模商用,成为AI集群标配;1.6T进入放量前夜,预计2027年规模上量。CPO(共封装光学)技术进一步将光模块与交换机芯片封装在一起,降低功耗、提升带宽。在这一领域,中际旭创、新易盛、天孚通信等国产厂商已基本实现自主可控。

散热则是另一个隐性战场。国产加速卡在高负载MoE场景下单卡功耗达500-700W,单机柜功耗从传统风冷时代的10kW飙升至40-120kW。K3的训练需要数万卡连续跑数月,推理需要7×24小时高并发,温控必须稳定在±1-2℃,否则性能会衰减。液冷由此从"可选方案"变成"必选项":冷板式液冷因成本低、易改造,占据市场九成以上份额;浸没式液冷则直接把服务器泡在绝缘冷却液里,散热效率最高,适配万卡级超高密度训练。英维克、高澜股份等头部厂商已实现万卡集群的规模化交付。

222.png

图:K3以2.8万亿参数,成为全球首个触及3T级别的开源模型 来源:K3 技术报告速览版

模型开源后,工具链升级比参数更值钱

7月27日,K3开放完整权重。这意味着企业可以本地私有化部署、微调与二次开发。但2.8万亿参数的MoE模型不是下载下来就能跑顺的,它带动了一整条工具链的升级需求。

编译器与推理加速是第一步。据中信建投梳理,月之暗面自研了MiniTriton编译器,性能对标OpenAI Triton;华为CANN、寒武纪CNToolkit针对稀疏计算做了深度优化,可将推理延迟降低30%以上。如果把大模型比作一辆跑车,编译器就是变速箱,决定了马力能否高效传导到车轮上。

深度学习框架也在适配。华为昇思MindSpore、百度飞桨已适配K3的训练与推理;旷视MegEngine、清华Jittor则主打轻量化版本,瞄准边缘侧的低功耗推理场景。

模型安全与私有化部署是政企客户的刚需。开源模型普及后,数据不出域、内容可审计成为硬要求。深信服、第四范式、商汤科技、奇安信等厂商,正提供模型水印、溯源、恶意指令拦截与内容审核服务。金融、医疗、政务等敏感行业的私有化部署需求,正在催生一个配套的"安全中间件"市场。

MaaS(模型即服务)则是离普通开发者最近的环节。阿里云、腾讯云首批上线了K3企业API,提供算力租赁、私有化部署与微调托管;华为云CodeArts集成K3,强化代码生成能力;软通动力、润和软件等集成商则承接行业定制化部署。对于中小公司而言,自建64卡超节点不现实,向IDC租赁K3算力成为主流选择,这也直接拉动了润泽科技、世纪互联等AIDC厂商的上架率和租金水平。

国产AI产业链的"系统闭环",K3跑通了

K3的发布,正在把国产AI产业链从"单点突破"推向"系统闭环"。一条由训练需求驱动的硬件替代链,已经悄然启动。

最显性的变化发生在算力层。据多家产业链机构分析,月之暗面在K3的训练集群中,已大规模采用国产服务器与加速卡替代英伟达A100/H100。这不是实验室里的概念验证,而是2.8万亿参数模型跑通后的工程实证,中金公司在研报中拆解指出,K3在昇腾910B上已完成全链路适配,Atlas 950 SuperPoD成为官方推荐的首选国产算力底座。当这条通路被验证可行,后续跟进的模型厂商就省去了从零开始的迁移成本,国产芯片、AI服务器、高速互联设备的需求,正从"政策驱动"转向"商业驱动"。

硬件替换的连锁反应,很快传导到基础设施层。据中金公司测算,国产加速卡在高负载MoE场景下单卡功耗达500-700W,单机柜功耗从传统风冷时代的10kW飙升至40-120kW。产业端信息显示,K3要求至少64卡超节点起步,这意味着只有功率密度达40-120kW/柜的AIDC智算中心才能承接。润泽科技作为月之暗面的长期专属智算服务商,机柜上架率直接受益;亚康股份则包揽了从服务器上架到集群运维的全栈服务。对于那些无力自建超节点的中小公司,向AIDC租赁K3算力成为主流选择,算力租赁市场的上架率和租金水平随之双升。

当算力底座夯实,应用层的变革才真正开始。据中金公司分析,K3面向长程编程、知识工作和推理场景设计,其用户画像并非普通网民,而是程序员、分析师等专业人群。中信建投在跟踪报告中提到,K3在海外已通过Cursor、Cline、Roo Code等AI编程工具嵌入全球开发者的IDE。这意味着K3实际上在争夺下一代"生产力入口",AI不再是一个对话框,而是融入工作流的底层能力。

把这些碎片拼在一起,一幅更完整的图景浮现。从昇腾芯片到曙光服务器,从800G光模块到浸没式液冷,从MiniTriton编译器到华为CANN工具链,K3验证了一条不依赖英伟达CUDA生态的平行体系。当这条链路在2.8万亿参数的规模下跑通,国产AI产业拥有的就不只是一款模型,而是一套真正意义上的"重型基础设施"。

333.png

图:万联摩尔AI生成

K3敢卖高价:专业级定位已被商业化验证

K3的定价策略在国产模型中显得"另类"。输入3美元、输出15美元的价格,较自家K2.6版本翻了近4倍。这是Kimi的一次主动"价格跳升",它不想打价格战,而是要抢占"专业级"心智。

444.png

图:海内外主流模型价格(K3定价为国产最高,但仅海外顶尖模型的1/2至1/3)

从实际测评来看,K3确实撑得起这个定价。中金公司在内部测试中尝试用K3搭建大模型观测网站和制作技术全景PPT,两个任务均在半小时内完成,前端设计、后端逻辑、数据更新均展现出高水准。而在编程这个"硬骨头"领域,K3的表现尤为突出。

在Kimi Code Bench和BrowseComp等测评中,K3的"得分/成本"比显著优于同档海外模型:它是Fable 5价格的三分之一,却在多项编程任务中与之持平甚至超越。

用户反馈也印证了这一逻辑:K3推理速度快,但消耗Token也非常快。这意味着它面向的不是偶尔查资料的普通用户,而是愿意用Token换效率的专业人群,如程序员、量化研究员、金融分析师、法律顾问。对他们来说,模型在半小时内完成原本需要一天的工作,15美元的输出价格完全可以接受。

商业化数据验证了这条路线的可行性。据中信建投跟踪,月之暗面的ARR(年度经常性收入)在2026年3月突破1亿美元,4月即翻倍至超2亿美元。其中海外收入占比已超过50%,长期目标瞄准70%。K3在海外的渠道布局也颇具章法:通过AWS Bedrock、GCP Vertex AI、Azure Foundry触达B端企业;通过Groq、Together AI、Fireworks AI覆盖对延迟敏感的开发者;通过Cursor、Cline、Roo Code等AI编程工具嵌入个人开发者的工作流。

开源不再是妥协,是领跑者的武器

回到马斯克那条推文。在AI大模型的牌桌上,被对手称赞往往比被用户追捧更有分量。这意味着你的技术路线,已经进入了顶级玩家的视野。

K3的价值,从来不只是2.8万亿参数,也不只是Frontend Code Arena上的一个全球第一。它的真正意义在于:当开源权重文件被下载到全球开发者的服务器,当昇腾910B集群在液冷机房中7×24小时满负荷运转,当800G光模块在机架间吞吐着专家模型的激活信号,一条由中国公司定义技术路线、由中国供应链支撑产能、由中国开发者贡献生态的AI产业链,已经跑通了。

这不是终点。但K3是一个必须记住的分水岭:从此,"开源"不再是跟随者的妥协,而是领跑者的武器。


数据来源: Arena.AI、Artificial Analysis、月之暗面(Moonshot AI)

研报来源:

中信建投证券:《月之暗面(Kimi):从长上下文到率先迈入万亿参数,Agentic可期》(2026.06.08)

中金公司研究部:《Kimi K3发布,国产开源模型的又一里程碑》(2026.07.17)

国金证券研究所:《Kimi K3能力大幅跃进,千问接入Apple智能》(2026.07.19)

报道来源:乐晴智库、36氪、新浪科技、智东西

免责声明: 本文仅供参考,不构成投资建议。

格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

工业的智变时刻:AI扎根,产业生长

市值观察 · 19分钟前

cover_pic

美国通胀回落的可持续性如何?

中信债券明明 · 1小时前

cover_pic

世界杯落幕,费列罗仍在打“加时赛”

创业最前线 · 6小时前

cover_pic
我也说两句