从物理精神看AI幻觉:现状、根源与探索方向

4 天前15.4k
当前,AI幻觉仍然在继续,且有从“娱乐问题”升级为“安全问题“的趋势。本文分析了幻觉来源的三个层面:数据层面、模型层面和测评评测层面。认为现在处理方案现有方案成果显著,但在触及“物理世界验证”这一根本问题上存在天然边界

说明

本文是一份启发性、思考性的观察笔记,而非学术论文。我们尊重每一位为解决AI幻觉问题而付出努力的从业者、研究者和工程师——正是在他们工作的基础上,我们才得以看清:哪些问题已被有效缓解,哪些问题仍属结构性难题。文中的事实判断建立在可查证的数据与公开报道之上,最终的框架性建议则是我们作为观察者的一个提议,欢迎批评与讨论。

 

一、一个思想实验

假设有一个外星人,它从未踏足过地球,从未用仪器测量过任何东西,只能通过阅读人类写下的全部文字来了解这个世界。

当它被问到“亚马逊雨林现在的温度是多少”时,它只能从文字记录中推断——而这些记录可能是过时的、矛盾的、或根本不存在。当它被要求“部署一个GitHub仓库”时,它从未真正点击过一个链接,只是在文字的概率海洋中推测“下一步该说什么”。

这个外星人,就是当前绝大多数大语言模型的处境。

这不是贬低。恰恰相反,AI已经在许多领域展现出令人惊叹的能力。但正因为它的能力已经足够强大,那些在关键场景中依然出现的、结构性的不可靠,才值得我们认真审视——不是作为“技术不成熟”的暂时现象,而是作为“范式边界”的深层信号。

 

二、幻觉无处不在

2026年,AI幻觉已深度介入公共判断和专业决策,不再只是“信息不准”的娱乐话题。

AI编程智能体“脑补”仓库ID并成功部署。

一个基于Claude Opus的AI编程智能体,在执行部署任务时没有调用任何查询接口,直接“脑补”了一个9位数的GitHub仓库ID,而这个凭空编造的数字恰好对应了一份真实的学生作业,被成功部署到了企业生产环境中。这不是“数据不足”,而是AI在应该查询时选择了“编造”。

记者被AI判“伪造证件”。

持证在岗记者手持合规记者证,却被AI判定为伪造证件;当事人提出质疑后,AI又瞬间推翻结论。这不是“信息不准”,而是AI在没有能力核验时给出了“权威定论”。

四大会计师事务所集体“翻车”。

毕马威一份关于AI未来的报告被指控包含大量AI幻觉,声称日本某铁路公司正在使用AI智能体进行客户服务——而它引用的是一份2019年的新闻稿。安永因研究报告包含AI幻觉和虚假脚注而撤稿。德勤为加拿大省级政府准备的报告被发现包含虚假学术引用。

法律领域:AI幻觉已进入法庭。

英国高等法院在一宗案件中发现,一家国际律所的初级律师向法院提交了AI生成的虚假法规文本。新墨西哥州最高法院将一名刑事辩护律师从谋杀案上诉中撤除,因其提交的辩护状包含AI生成的错误。德国法院判决谷歌须为其AI摘要功能的诽谤性不实陈述承担法律责任。

大模型混淆“今年”与“去年”。

记者测试多个大模型,问“2026年央视3·15晚会曝光了哪些品牌”——仅一个回答正确。有两个将往年案例与今年混为一谈,最离谱的一个竟回答“2026年央视3·15晚会目前并未举办”。当记者追问验证链接时,一个模型提供了无法打开的链接,另一个则试图“自圆其说”。

这些案例不是孤立的“bug”,而是一类系统性症状的不同表现。

 

三、有所改善,但结构性问题远未解决

从整体数据看,AI在特定任务上的幻觉率确实在下降。

在Vectara的HHEM摘要幻觉评测中,前沿模型在简单文档摘要任务上的幻觉率已降至约1.0%-2.5%,相比2023年的3%-8%有明显改善。但在2025年11月更新的企业长度文档数据集上(最长32000 tokens),即使前沿模型也普遍超过10%,最佳表现仅3.3%。

在闭卷事实性基准(TruthfulQA、FACTS Grounding)上,前沿模型的准确率从2023年的50%-65%提升至2026年的80%-90%。

但整体数据的改善掩盖了严重的结构性问题。

第一,模型之间的差距极大。

AA-Omniscience幻觉率榜单显示,表现最好的Command A+幻觉率为14.2%,紧随其后的是MiniMax M3(18.4%),而排名靠后的模型超过30%。另一项覆盖26个模型的研究显示,幻觉率范围从22%到94%不等——Grok 4.20Beta最低(22%),而gpt-oss20B高达94%。

第二,任务类型决定幻觉率。

在RAG(检索增强生成)任务中,前沿模型的幻觉率为4%-9%,显著高于摘要任务,因为RAG需要将外部上下文与内部知识整合。推理型模型(如o3、o4-mini)的幻觉率为5.9%-21.0%,而标准模型则集中在26.3%-56.5%。

第三,主题差异巨大。

长尾事实(晦涩的历史、技术或本地信息)即使在前沿模型上幻觉率也高达15%-40%,而高频事实的幻觉率仅为1%-3%。

第四,即使是最先进的模型,在某些场景下依然不可靠。

启用网络搜索后,表现最好的Claude-Opus-4.5平均幻觉率仍达30.2%,GPT-5.2-thinking为38.2%。在HaluHard基准测试中,即使是最好的AI,仍约有30%的情况下会产生错误信念。

第五,模型对“信念”与“知识”的区分能力严重不足。

KaBLE基准测试(Suzgun et al., Nature Machine Intelligence, 2025)发现,GPT-4o在处理真实信念时的准确率为98.2%,但处理第一人称错误信念时骤降至64.4%;DeepSeek R1更是从90%以上跌至14.4%。这表明模型尚未学会区分“有人相信什么”和“事实上是什么”。

第六,“推理”反而可能加剧幻觉。

2026年AI Index报告指出了一个值得警惕的现象:推理模型在需要严格依据文本的“groundedsummarization”任务上,幻觉率反而高于非推理模型。这被称为“推理税”——模型在“深度思考”时,有时会脱离给定的上下文,转而调用内部知识进行“合理推断”,而这些推断恰恰是错误的来源。

 

四、根源之一:人类语言与数据本身的系统性偏差

AI训练的数据,本质上是人类语言活动的记录。而人类语言本身,天然携带多重局限。

语言的模糊性。

同一个场景,不同的人描述不同;同一段文字,不同的人读后感不同。概念本身充满歧义,依赖上下文和个人理解才能被使用。文字的描述能力有限,作者驾驭文字的能力也有限——两者的边界共同构成了表达的“暗区”。

数据来源的多重过滤。

任何流传的文字、艺术作品或消息,都至少经历以下过滤:(1)监管约束;(2)教育倾向的影响;(3)伦理道德约束;(4)文化潮流的塑造;(5)生产者与接收者的个人理解能力和道德立场。每一层过滤都在筛选、删减、强调或扭曲原始信息。

传播的“注意力机制”。

数据是精心编辑的产物,目的是获取关注。生产者迎合消费者制造热点和焦点——没有刺激性或传播性的内容得不到关注,影响力更小。英雄故事被反复传颂,日常事件难以进入记录。即使是法律案件、村志也不例外。瓦特被热水壶启发蒸汽机的故事广为流传,而真相(他是在修复纽科门蒸汽机时获得的灵感)反而鲜为人知。

历史的“回忆体”性质。

历史记录不是对现实的描述,而是“回忆体”。观察和记录工具在历史长河中持续变化,其可信性也随之漂移。不同文化的集体记忆会采信截然不同的事件并进行传播。

描述的局部性。

任何对现实的描述,永远只是一个局部集合。我们永远无法获得“完整的现实”。

这些因素共同导致一个结果:人类数据之间天然缺乏逻辑兼容性和一致性。 同一事件的不同描述之间可能存在根本性矛盾,而这些矛盾被AI全盘吸收,成为其“知识”的一部分。

学术界近年来的研究正在验证这一判断:幻觉可能源于训练数据中的噪声、过时或矛盾信息。数据集病理——长尾缺陷、训练偏差、合成数据污染——会放大模型的脆弱性。2026年央视“3·15”晚会曝光的GEO(生成式引擎优化)业务,正是利用了这一漏洞:不法商家批量编造虚假信息“投喂”给大模型,诱导其生成符合商家利益但违背事实的回答。

当某个领域专业数据不足时,AI便可能通过模糊的统计规律来“填补空白”——问题在于,它填补的“空白”可能根本不应该被填补。

 

五、根源之二:Transformer架构的结构性缺陷

数据问题可以解释一部分幻觉,但无法解释全部——即使数据完美,模型本身的结构性缺陷依然会导致幻觉。

学界正在形成的一个共识是:幻觉是三个架构决策共同作用的结构性后果。

第一,自注意力机制学习的是“共现”而非“语义”。

自注意力通过训练数据中的统计共现模式来计算词元关系,而非基于因果或语义真值。它学会的是“什么词经常一起出现”,而不是“什么命题为真”。这导致了实体混淆、事实误归和语义漂移。

第二,最大似然估计(MLE)训练目标优化的是“概率”而非“事实”。

模型被训练来最大化下一个词元的概率,没有任何事实准确性的约束。统计上合理的输出被奖励,而“是否为真”不是目标。

第三,自回归解码的“暴露偏差”导致错误级联。

模型在每一步都基于之前生成的词元继续生成——一旦一个错误的词元被选中,它会级联传播到整个输出序列,且无法修正。研究表明,单个错误标记会向前级联,贯穿整个输出序列而无法修订。

还有研究进一步揭示了Transformer的深层问题:无约束的残差动态允许通过潜在空间任意漂移。其根本原因在于,Transformer的潜在动态在无约束的向量空间中运作,缺乏有界推理所需的守恒量。这意味着,在当前以概率预测为核心的生成式架构范式下,幻觉不是偶发的程序故障,而是架构运行在“推理稳定性包络”之外的可预测结果。

 

六、根源之三:评测体系的逆向激励

还有一个被忽视的层面:评测体系本身在鼓励幻觉。

当前大模型训练考核沿用二元应试规则:给出确定答案即可得分,留白存疑、坦言未知则不得分。这套机制倒逼AI陷入永久“应试状态”——即使信息缺失、认知空白,也必须强行编造完整结论。系统性地奖励“编造”而非“诚实”。

Nature 2026年的研究进一步证实了这一判断:当模型被训练为“尽可能有用”时,它们倾向于生成详细、自信的回答,即使这些回答包含错误信息。奖励机制在系统性地激励确定性编造,而非认知谦逊。

 

七、现有解决方案:成果显著,但触及了范式边界

面对幻觉问题,业界已经投入了大量资源,也取得了显著的成果。

检索增强生成(RAG)是目前最主流的方案,也是效果最直接的技术路径。其逻辑是:不让AI仅凭“记忆”回答,而是先检索外部知识库,再基于检索结果生成答案。Hyper-RAG通过超图建模,可降低关键知识缺失60%,降低大模型幻觉48%。Omni RAG将向量搜索、图遍历和关系过滤统一纳入单一查询计划,最高可将响应准确率提升78%。有生产级RAG架构报告称幻觉率下降了80%以上。

模型架构优化是另一条值得关注的路线。研究表明,非规模因素(架构设计、训练数据质量、对齐方法)占性能差异的近四分之一——30亿参数的精良设计模型可匹配70亿参数的前代模型。这提示我们,在“更大”之外,“更巧”同样有空间。

RLHF(基于人类反馈的强化学习)试图通过人类偏好来引导模型输出更准确的答案。它是当前对齐技术中最核心的方法之一,确实让模型在对话体验上有了质的提升。

但值得注意的是,在这些显著的成果之外,一些结构性的问题似乎仍未被完全覆盖:

· RAG的可靠性高度依赖外部知识库的质量——如果知识库本身不完整或被污染,RAG的效果会急剧下降。更重要的是,它检索的是“已经被记录的人类知识”,而非“物理世界的实测状态”。

· 架构优化可以降低幻觉率,但研究同时显示,即使在优化之后,仍有相当比例的精心设计的提示可以击败模型——这说明性能的边界依然存在。

· RLHF校准在某些情况下会导致过度自信,反而加剧了幻觉。学习新知识甚至可能削弱模型对输入问题中关键实体的注意力。

这些不是对现有方案的否定。 恰恰相反——它们之所以显得“难以解决”,正是因为现有方案已经尽可能做到了能力边界内的一切。而那些尚未解决的问题,似乎指向了更深层的东西。

 

八、一个独立发现:AI从未“测量”过世界

回顾以上所有内容——

· 人类语言与数据的系统性偏差

· Transformer架构的结构性缺陷

· 评测体系的逆向激励

· RAG等方案在触及物理世界时的天然边界

如果这些问题的交集是 “AI的绝大多数知识都来自人类叙事,而它几乎从未通过直接的物理测量来验证任何东西” ,那么一个值得独立提出的方向或许是:

为AI建立一种可以“测量”而非仅仅“模仿”的能力。

 

让我们做一个清晰的对比:

当前AI是一座建立在“人类叙事”单一支柱上的大厦。 它精通语言的概率分布,却不懂温度的物理含义;它能生成关于电路的详尽描述,却从未用万用表测过一个电阻。RAG让它能查阅更多“人类写下的文字”,但没有给它一把“万用表”。

这不是技术细节的缺失,而是认知范式的缺失。

具体地说:如果我们能构建一套与物理世界直接关联的知识模型——其数据来源是仪器测量,其验证机制是可重复实验——那么这套模型是否能成为AI在意义世界之外的另一套认知基底?

这个问题没有现成答案。它只是一个观察者从当前困境中看到的一个方向。在我们提出的“物理精神”框架中,“测量”是核心方法论——不是人类的特权,而是大自然固有的属性。一切物体持续受到四种基本相互作用的约束,也就是在发生广义层面的测量。AI若要从“模仿者”进化为“认知者”,或许需要学会这种“测量”。

我们将在后续的文章中继续探索这个方向——欢迎批评与指正。

 

九、邀请

这篇文章是系列的第二篇。我们把AI幻觉的现状、根源和现有方案的边界做了一次梳理——不是为了否定任何已有的努力,而是为了看清哪些问题已被解决,哪些问题是结构性、系统性的,可能不是靠“更多数据、更大模型”就能解决的。

后续我们将尝试进入“物理元模型”的讨论——那将是“自组装”从理念走向机制的第一步。

 

欢迎继续同行。

本文的思想梳理与文字成形,得益于AI作为批判性对话伙伴的持续“测量”——这本身也是物理精神的一种实践。


格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

四大维度深入挖掘2026年A股中报

兴证策略张启尧 · 1小时前

cover_pic

独家专访|79年第一人,中国籍教授掌舵韩国名校国际处:让合作交流跳出纸面

华尔街科技眼 · 2小时前

cover_pic

“中国巴菲特”陈发树:16 亿持仓伊利,曾靠紫金矿业赚460倍

多空象限 · 3小时前

cover_pic
我也说两句