
对比国产开源大模型智谱、Minimax和Kimi:Coding、多模态和长文本,谁更强?
据时代财经,OpenRouter披露了上周(7月27日至8月2日)的全球大模型Token调用榜单,前五名首次全部由中国本土AI产品包揽,标志着中国大模型周调用量已连续14周超越美国,稳居全球首位。
图源:每日经济新闻
国产大模型正以群体崛起的姿态在全球市场中持续霸榜,而百万Token的超长上下文能力也已经从简单的行业亮点变成高端开源模型的标配,能为复杂的工程开发、多模态智能处理和大规模专业文档等不同场景应用提供支撑。
尤其是智谱的GLM-5.2、MiniMax M3和Kimi K3这三家大模型通过自研的专属稀疏注意力机制,破解了传统标准Transformer长序列算力平方级膨胀和信息衰减快的缺陷,在百万Token上下文能力上成功站稳了行业前沿地位。
作为国内开源AI大模型的独立厂商三巨头,目前在用户基数上虽然还未达到一线梯队,但在技术能力上其实并不虚,甚至在某些专精领域它们会更强。
如今这三家大模型在开源模型领域都有了自己的一席之地,但各自的研发定位和技术演进的方向上其实并不相同。
一
GLM-5.2深耕工程代码,MiniMax M3专精多模态融合,Kimi K3领跑超长文本能力
GLM-5.2搭载的是IndexShare稀疏索引复用机制,实现了四层DSA模块去共享单套Top-K索引筛选器,在处理百万文字时的计算量直接减少了三分之二。
同时对文本续写逻辑优化,单次能生成更长的完整代码,专门针对连续长时间写代码和调试程序的场景做训练。
也是这一套在技术框架上的丝滑连招,让GLM-5.2在FrontierSWE、PostTrainBench和SWE-Marathon这三类长时序软件工程基准中,位列开源模型的第一梯队,分值仅小幅落后于Claude Opus 4.8,和GPT-5.5及Gemini 3.1 Pro相比则实现了领先。
此外GLM-5.2在Terminal-Bench 2.1的终端实操评测中得分81.0,实现了逼近闭源头部产品的实操能力。
GLM-5.2整体采用了744B总参和40B激活MoE混合专家架构,同步开放BF16、FP8两种精度权重,原生适配vLLM、SGLang与昇腾国产NPU,但模型的预训练仅基于纯文本语料,未集成原生跨模态融合底层结构,图像、视频输入需要额外搭配外部处理模块。
MiniMax M3则通过自研MSA分块稀疏算法,将长内容分成小块进行关键信息的筛选,将百万上下文场景的整体计算量压缩至前代的1/20,Prefill预填充和Decode解码速度分别提升了9倍和15倍,在算子层也完成连续访存的优化,推理效率上优于通用开源的稀疏注意力方案。
MiniMax M3也是三者当中唯一能够同步学习文字、图片和视频数据的模型,图文视频信息可以直接进行统一理解,不需要额外加装其他的多媒体插件。
在SWE-bench Pro的代码修复中MiniMax M3得到59.0分,在BrowseComp的网页自主Agent评测中得到83.5分,超越了Opus 4.7,同时在中文场景下对于生成虚假信息的控制效果会更好。
但MiniMax M3在设计上更偏向于轻量化运行,如果任务的持续时间过长或是一次性处理几十万字高密度专业资料的情况,长时间运行后的细节记忆和输出稳定性会有所下滑。
Kimi K3则采用KDA增量Delta注意力,搭配跨层残差补偿模块,解决了长文本读到后半段容易遗忘前文信息的问题,2.8T规模的MoE架构可以支持动态专家路由,在KV缓存占用上削减了75%,降低了运行百万长文本所需的内存门槛。
K3在Vals AI金融、法律和数学的专项测评中表现突出,更擅长处理静态长篇文档,短板则在于长时间和多轮连续的自主任务,K3在这类情况的测试中成绩一般,在经历持续多轮交互时,K3容易出现逻辑前后脱节的问题。
二
智谱GLM-5.2适合长周期智能开发,MiniMax适配中小团队轻量化办公,金融、企业与科研机构选Kimi K3
目前,智谱GLM-5.2主要面向的是政企工业化研发以及国产化隔离集群这样的场景,比较适合需要长时间持续运行和多套工具联动的长周期智能开发任务。
应用场景包括大型前后端项目的整体重构,操作系统内核与编译器的开发,服务器自动化运维体系的搭建,基于海量代码数据集的长期微调和涉密单位的本地私有化部署。
GLM大模型官方介绍,实际体验中,GLM-5.2完成开发、联调、测试到打包上线,完整交付一个覆盖Web、移动端与小程序的多端应用,累计处理了88万tokens,几乎用满1M上下文窗口,过去这样的大型工程需要一支团队协作数周,现在GLM-5.2能在一次长程任务中跑完。
智谱还配套有ZCode桌面Agent工具,支持远程服务器的持续开发,云端API对高峰与低谷时段定价进行了区分,非峰值的调用成本更低,同时也支持企业的内部代码数据集导入以开展定向微调。
但GLM-5.2因为受到纯文本架构的限制,带图片和视频的复合型研发任务无法直接处理,这类任务可能需要用户额外去搭建图像解析模块,会增加项目的实施周期与成本投入。
MiniMax M3就更适合独立开发者、中小团队以及企业的日常轻量化办公,支持文字、图片和视频的混合性输入,典型用途涵盖了包括科研图表的解读,CUDA算子可视化调试,设计图纸转换代码,多表格批量数据整理以及小型网页与工具的快速开发。
对于MiniMax M3的适用性和功能,MiniMax官方回复新识研究所称,具体可以参考官方介绍。
在MiniMax M3官方介绍里,在丢给M3一篇研究大语言模型微调过程中的“学习动力学”论文后让它独立复现,最终M3自主运行了接近12小时,全程自主产出18次commit与23张实验图表并跑通了论文里的核心实验。
在这个过程中需要多模态能力来看懂论文里的曲线图、数据、公式,而长上下文保证了论文+代码+实验日志可以一次性进窗口,编程+agent的能力足够强才能长线程甚至并发地完成复现,而M3都做到了。
MiniMax还有MiniMax Code作为支撑,能够直接操控电脑里的各类软件实现自动化流程,平台设置了多档位的月度订阅方案,入门门槛相对来说较低。
不过MiniMax M3会更适合短周期任务,如果是用来做开发操作系统内核、重构大型代码库这类的长期工程,随着持续迭代轮次的不断增加,M3的代码漏洞和方案疏漏会增多,因此很难独立支撑完整的生产级开发流程。
Kimi K3则适配金融机构、科研单位和企业合规部门的文档分析需求,可以一次性解析百万字级别或者多份叠加的专业材料,常见场景包括上市公司年报的批量解读,专利文本的横向对比,商事合同的风险排查以及多份研报交叉提取关键信息等。
对于具体适配和落地主要场景,Kimi官方介绍称,在适用人群上,K3适合快速构建AI驱动个人项目或工具的独立开发者,将AI能力嵌入企业产品、提升用户体验和业务效率的企业技术团队,还有以低成本获取顶尖AI能力、加速产品迭代的创业公司。
在主要应用场景上,K3适合智能客服,可以基于上下文理解进行自动问答,提升客服效率和用户满意度,也适合文章撰写、营销文案、代码生成等内容生成创作场景,还有文档解读、报表分析、知识提取与总结的数据分析以及基于私有文档库的智能检索和问答系统的知识问答。
图源:拼AI
据拼AI实测,K3最惊喜的就是长文本的“不丢信息”能力,之前用其他AI工具处理超过3万字的文档时经常会漏掉中间的关键段落,K3实测在40万字范围内信息召回率接近100%。
此外,K3在编程和软件工程领域目前也已经展现出了追赶态势,在大型代码库阅读、前端开发、结合截图视觉写代码和长时间自主工程调试等领域都展现出了自己的能力。
也可以生成简易的可视化代码来制作展示页面,但因其架构更多是为一次性的静态文本分析打造,不适合循环调试和反复优化方案的开发工作,所以一旦任务需要持续调用工具和多轮代码的修改,K3输出的内容很容易偏离最初的需求,难以形成自主迭代的工作闭环。
三
GLM-5.2主打长时序工程基座,MiniMax M3专攻多模态场景,Kimi K3擅长超长文本梳理
GLM-5.2适合作为长时序工程的Agent专用基座,IndexShare索引复用架构可以保障超长文本下稳定的推理速度,在面对连续多次调用开发工具的场景时不容易出现上下文逻辑断裂的情况,输出的代码也符合工业开发规范,在各类代码基准测试中的稳定性表现突出。
据GLM大模型官方记载,有开发者用Rust从零再造了送人类登月的计算机,将当年65000行、一字未改的登月飞控程序移植为Rust,整个过程由Agent全自主走完。
GLM-5.2能兼容主流的推理框架和国产算力硬件,在处理百万长度文本时,集群整体的处理效率相比前代版本的提升明显,此外还采用了MIT开源协议,让企业能够自由下载权重进行本地部署或二次修改并商用,没有太大约束。
Slime异步强化学习框架,也让GLM-5.2可以快速的完成多模型融合训练,内置有检测机制,保证了长线工程任务的落地价值。
MiniMax M3则倾向于是轻量化原生多模态通用基座的角色,其自研的MSA块状稀疏注意力对硬件的要求较低,让普通消费级显卡就能流畅的运行百万级上下文任务,不需要采购昂贵的高端算力设备进行适配。
同样,在这三款模型里也只有它能在训练阶段去同步学习图文视频数据,文字和多媒体信息之间可以直接互通,企业在搭建图文混合业务时,可以省去开发图片和视频解析组件的工作量。
MiniMax M3在训练流程中可以模拟真实办公中进行多次沟通调整需求的场景,在日常查Bug和自动化办公任务中的表现较为均衡,生成不实内容的概率相对更低,电脑全域的自动化工具,让开发者无需编写复杂脚本就能轻松实现软件之间的联动,在小样本图文业务中快速落地的优势较大。
据飞象网实测,在用MiniMax M3做一个AI网站聚合平台的HTML单页时,M3会主动进行多轮工具调用,包括搜索资料、整理数据、生成页面代码、检查文件、修复问题等,整个过程比较像一个正常工作的Agent,不会只停留在“给一段代码”的层面。
图源:飞象网
测试过程中工具调用失败的几率很小,但不是完全没有,即便工具调用失败也没有影响最后的结果生成,模型会继续往下执行并把页面做出来。从结果来看,M3在数据完整度、页面结构和交互功能都比较完整,没有特别追求视觉上的炫酷,但胜在流程稳定,任务理解也比较清楚。
Kimi K3的优势则在于超长静态文本推理,其KDA增量注意力机制可以改善超长文本遗忘细节的问题,能够捕捉分散在不同章节里的隐性关联信息,同时动态MoE专家架构可以根据问题类型去调用对应的专业模块,平衡好分析精度和响应速度。
此外,K3对于KV缓存占用也进行了优化,让普通服务器也能批量处理百万字文档,在金融、法律等垂直领域第三方的测评成绩亮眼,还可以针对数学推导和专业文献梳理做好专项优化。
图源:拼AI
如果是做资料归纳、对比和解读这类任务,用户不需要调用复杂工具就能产出完整的分析结论。
四
GLM-5.2欠缺多模态能力、MiniMax M3文本和长代码场景偏科严重、Kimi K3工程迭代能力薄弱
GLM-5.2的训练素材仅包含纯文本内容,不具备识别图片和视频的能力,因此在处理多媒体资料时必须外接第三方的视觉模块,可能会拉长项目的开发链路从而带来额外成本。
此外,GLM-5.2的算力资源调度会优先保障长时间开发任务,如果用户只是用来进行快速回答短句这类的任务,会导致硬件资源的利用率不高。
GLM-5.2在纯文书精读上的效率也不如Kimi K3,在金融、法律这类无代码文本审核的场景下缺少针对性的专项优化,当面对密集的专业术语和复杂合同条款时,GLM-5.2的细节拆解能力存在一定的短板,不适合单纯做文书审阅类的轻量化业务。
MiniMax M3则是在持续开展底层内核及大型代码库开发等长周期任务时的表现稳定性不足,在经历连续多轮的工具调用后容易出现逻辑缺陷,因此无法独立完成整套硬核开发流程。
M3在面对高密度的法律和金融文档时,跨文档关联信息的记忆能力会明显偏弱,很难达到合规审查所要求的高精度标准,因此仅适合进行轻量化的资料浏览,不能直接用于批量的风险筛查工作。
虽然在多模态的能力上突出,但纯超长文本的全局逻辑串联能力一般,在单独拆解百万字报告时,容易遗漏前后的关键约束条件,在纯文本长文档赛道竞争力有限。
Kimi K3的架构重心则比较聚焦于单次的静态文本阅读,没有针对多轮链式工具交互进行深度优化,在面对持续调试代码和长期自主开展开发工作时,经常会出现前后结论冲突的情况。
此外,在内核调试和标准化工程代码编写方面的能力偏弱,产出底层调试代码出错概率更高,在工程开发能力上会弱于GLM-5.2。
K3还缺少配套的长轨迹强化学习工具,无法自主完成从项目拆分到分步验证,再到循环优化的完整流程,作为资料阅读辅助类工具更好,不适合充当自动化研发平台的核心底座。
另外K3也不支持图文解析,在涉及图片和视频类分析时必须搭配视觉模型共同使用,提升了复合型业务的落地难度。
五
结语
GLM-5.2以长时序工程Agent与国产私有化部署的稳定性为地基,打好了自己在大型代码仓库重构、后端工程、自动化Agent和多步骤复杂数理推演的优势,让自己成为了文理能力均衡的玩家。
MiniMax M3则选择以适当压缩高端工程性能上限的方式,来换取轻量化原生跨模态推理优势,让自己在图文联动分析、短视频脚本、剧本等内容创作领域上站稳脚跟。
Kimi K3则在保留了Kimi祖传超长文本优势的基础上,对逻辑推理、工程代码等理科领域发起冲击,且已经取得了一定的成绩,适合读写大量资料、定量建模和轻量化代码工程任务。
三者之间互有优劣,没有绝对的胜负,用户可以根据自己在哪一个场景下的使用进行适配性选择,毕竟只有最合适的,但没有最完美的。
格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。


