AI 为什么会一本正经地胡说?怎么判断它说的是不是真的

它不是在查真相,是在补一句最像答案的话——搞懂这点,你就不会再被它坑

省流版:AI 会胡说,业内叫「幻觉」。它不是数据库,不会查证,干活方式是「猜下一个最像样的词」。所以它记不清的地方,不会承认空白,而是编一段读起来很合理的话——假论文、假数据、假链接都这么来的。判断真假的办法只有一条主线:凡是能被事实证伪的内容,默认自己再核一遍,别信它读着顺。

「幻觉」到底是怎么回事

你大概都遇到过:让 AI 推荐几本书,它给的书名、作者、出版社写得有鼻子有眼,结果一搜,有一本书根本不存在。或者让它找一篇支持某个观点的论文,它给了标题、期刊、年份,链接也像模像样,点进去却是 404。它不是在跟你开玩笑,它是真「以为」自己说得对。

这种「它编了一个根本不存在的东西,还说得特别笃定」的现象,业内有个固定叫法,叫幻觉(hallucination)。注意这个词容易让人误会——它不是 AI 出了故障,也不是它想骗你。幻觉是这类工具的底层特性,不是偶尔抽风的 bug。理解了它为什么会这样,你才知道该在什么地方对它多留个心眼。

打个比方。你考试遇到一道不会的题,但卷面不能空着,于是你顺着题目的语气,编了一个「看起来像那么回事」的答案——格式对、术语对、语气笃定,就是内容是瞎掰的。

AI 干的就是这件事,只不过它每一句话都在这么干。区别只在于:会的地方它编得正好对,不会的地方它编得一本正经地错。而它自己分不清这两者的差别。

它为什么不肯说「我不知道」

要讲清这件事,得先说一句它干活的本质。像 ChatGPT 这样的大语言模型,做的事情说穿了很朴素:根据你给的上文,一个词一个词地预测「接下来最该出现的词是什么」。它不是在一个事实库里查答案,它是在「补全」一句话,补得越像人写的,它就觉得越「对」。

这里有个关键:它衡量「好不好」的标准,是这句话像不像一个合理的回答,而不是这句话是不是真的。这两个标准大多数时候重合,所以它显得很懂;可一旦你问到它训练时没见过、或者记得模模糊糊的内容,这两个标准就分叉了——最「像答案」的那句话,未必是真的那句话。

而它没有「我不确定,所以停下来」这个机制。对它来说,「我不知道」也只是一种可能的下文,而在它学过的海量文字里,绝大多数问答都是直接给答案的,很少有人写「这个我不清楚」。所以它默认的倾向就是把话补完、补得自信,哪怕是编的。

一句话记住:它流畅不代表它正确,它笃定更不代表它正确。语气自信只能说明它在模仿「自信的人怎么说话」,跟内容真假是两码事。

最常见的四种翻车现场

幻觉不是随机出现的,它有几个高发区。认得出这些场景,你就知道什么时候该多核一遍。

一、编参考文献和出处

这是最经典、也最害人的一种。你让它「找几篇支持这个观点的论文」「给我引用来源」,它会给出格式完美的文献——标题、作者、期刊、年份、页码一应俱全,看着就像从数据库里抄出来的。但其中很可能有几条是拼出来的:作者是真的、期刊是真的,论文却不存在;或者把两篇真论文的信息缝在一起。学生、研究者最容易栽在这里。

二、编精确数据

问它「这个市场多大」「这个比例是多少」,它经常报一个非常精确的数字,比如「占比 37.4%」。精确反而是危险信号——真实数据通常带来源、带年份、带口径,而它给的光秃秃一个数字,往往说不出可靠出处。它给得越精确、越没出处,越要警惕。

三、编链接和网址

让它「给个官方文档的链接」,它会生成一个结构上完全合理的网址——域名对、路径像模像样,点进去却是错的页面甚至打不开。原因还是那句话:它在「补一个像链接的字符串」,不是在「查一个真实存在的页面」。

四、把不确定的事说得很笃定

这种最隐蔽。它对一件其实没把握的事,用了「众所周知」「研究表明」「显然」这类口吻,让你不由自主地信了。还有一个反向信号特别值得记:你追问一句「你确定吗」,它经常立刻改口道歉、然后再给一个不一样的答案——这恰恰说明它根本没有「确定」这个概念,前一个和后一个都只是「像答案的话」而已。

一眼识别幻觉高发区

为什么编的东西看着比真的还像真的

很多人第一反应是:那我读一遍不就看出来了吗?编的总该有破绽吧。问题恰恰在这——它编的东西通常没有破绽,因为它最擅长的就是把话说得像样。

真人瞎编,常常会露馅:语气心虚、格式不对、术语用错。但 AI 不会,它学的就是「一个真实的出处长什么样」「一段权威的数据怎么写」,所以它生成的假内容,在外观、格式、术语、语气上和真的几乎一模一样。差别只在一个地方:内容是不是真的存在、对不对。而这个差别,光靠读是读不出来的。

所以判断真假有一条铁律:不能靠「读着顺不顺、像不像真的」来判断,只能靠去原始来源核对。越是看起来权威、越是让你想直接信的内容,越值得花那一分钟去查。

一套自己判断真假的方法

知道它会胡说还不够,得有一套能上手的核对动作。下面这套,从轻到重,按内容的重要程度用就行。

  1. 先分清这是「观点」还是「事实」。如果它是在帮你梳理思路、给写作建议、换个说法解释概念——这类没有「真假」之分,放心用。要核的是能被证伪的事实:人名、数字、日期、出处、法规、价格、引用。
  2. 让它给出处,但别信它的转述。追问「这个说法的来源是什么,给我可以查的链接或书名」。拿到之后,自己去原始来源点开核对——确认这个来源真的存在、并且真的说了它转述的那句话。出处是它给的,验证得你来做。
  3. 交叉核对:换个地方再查一遍。同一个事实,去搜索引擎、官方网站、或权威数据库再搜一次。两边对得上,才比较可信;只有 AI 这一个出处,等于没有出处。
  4. 对高风险内容,默认不信。涉及健康、法律、报税、签合同、投资这类「错了有真后果」的事,把它的回答当成「帮我先听懂专业人士在说什么」的背景材料,结论一律去找有资质的人确认,不要直接照它的话做决定。
  5. 用它的「不一致」当探测器。同一个问题,换种问法、或新开一段对话再问一遍。如果它每次答得都不一样、还互相矛盾,说明这件事超出了它可靠的范围,这时候它给的任何一个版本都别信。
抓重点:核对的成本,永远比「信了假信息然后出事」的成本低。把「凡是事实就再查一遍」变成肌肉记忆,你就能拿到 AI 的效率,又躲开它的坑。

换个问法,能少踩多少坑

你没法让幻觉彻底消失,但好的问法能明显降低它的发生,也能让它的不确定暴露出来,方便你判断。几个性价比最高的写法:

想系统地把问法练好,可以接着看下面那篇讲提示词的文章;这里只要记住一点:好的问法能减少幻觉,但减少不等于消除,最后那道核对关还是省不了。

哪些场景默认就别信它

有些场合,幻觉的代价太大,不值得赌。遇到下面这些,直接把「默认不信、必须核」设成你的出厂设置:

这几类内容,默认按「可能是编的」对待

提醒:本站是独立教育站,只教你看懂工具、自己做判断,不替你下结论,也不会要你在本站输入密码、验证码或证件。你看到的任何「事实」,包括本文里的,都欢迎你按上面的方法自己核一遍。

常见问题

AI 真的会胡说吗,还是它在故意骗人?

它不是故意的,也没有「骗」的概念。它的工作方式是预测下一个最像样的词,不是去查证真相。碰到记不清的地方,它不会停下来说不知道,而是顺着语感补一句听起来最合理的话,这就是幻觉。所以它流畅不等于它正确,这两件事在它身上是分开的。

为什么 AI 编出来的内容看起来那么像真的?

因为它学的就是怎么把话说得通顺、像样。一个假的论文名、假的网址、假的数字,在格式和语气上和真的几乎一样,它擅长的正是模仿这种样子。看起来权威,恰恰是幻觉最危险的地方,所以不能靠读着顺不顺来判断真假。

怎么判断 AI 说的是不是真的?

三步。第一,凡是人名、数字、日期、出处、法规、价格这类能被证伪的内容,默认要自己再查一遍。第二,让它给出处,再去原始来源点开核对,而不是信它转述的版本。第三,高风险话题,比如健康、法律、报税、合同,默认不信它的结论,去找有资质的人。

让 AI 自己说有没有出处,靠谱吗?

让它给出处是好习惯,但出处本身也可能是它编的。真正的核对是拿它给的网址、书名、论文名去原始数据库或官网搜一遍,确认确实存在、内容也对得上。它说有出处,不等于出处是真的。

想自己核对?这些是出处

幻觉是这类模型公认的局限,各家官方文档都写得很明白。下面几处可以自己读,别只信任何二手转述(包括本文):

更新:2026-06-28。本文仅用于教育说明,不构成专业建议。AI 模型一直在更新,但「会产生幻觉」这一局限目前仍然存在,重要内容请始终以原始来源核对为准。