AI 会一本正经地胡说,是因为生成一段合理、连贯的语言,与确认这段话在现实中真实,是两件不同的事。模型可能在缺少依据时补出细节;这种看似可信却错误或无根据的输出,常被称为“幻觉”。

一句话理解:语气不是证据

“幻觉”是技术讨论中的比喻,不表示模型像人一样看见不存在的东西,也不必然意味着它有意撒谎。对使用者而言,关键是检查答案是否有证据,而不是猜测模型的心理状态。

幻觉可能是一篇不存在的论文、一条打不开的来源链接,也可能只是把原文中“计划下周完成”改成“本周已经完成”。后者没有离奇内容,却同样会使你的周报失真。

为什么缺材料也能写得很像

语言模型在训练中学到大量表达和关联,生成时根据输入组织后续内容。它可能知道参考文献的常见格式,却没有查到某篇文章;也可能把两个相近人物的信息混在一起。正确的格式无法保证正确的事实。

提示中缺少条件、资料彼此矛盾、知识未及时更新或任务超出能力,都可能让结果出错。不能把原因归结为“它没有联网”这一项:联网后仍可能找到不可靠页面、误读内容或把不同来源拼接错。

流畅表达也不是模型给出的可靠置信度。即使你要求它说出“有多确定”,这个自报数字也不应该直接当作经过校准的正确率,更不能替代外部证据。

用一段活动通知练习辨认

以下是虚构教学材料:“读书分享会将在周末线上举行,具体时间待定,参与方式稍后公布。”如果总结里出现“周六晚八点扫码参加”,新增的时间和方式就没有依据。

检查时可把输出分成三类:原文明确说过、合理但未确认的推测、无法找到依据的新增内容。推测并非一律没用,但必须标明,不能悄悄混进事实段落。

这类小例子适合培养习惯,因为你能掌握完整材料。面对陌生领域的长报告,不应仅凭“看起来专业”跳过核验。

一套可执行的核对顺序

  • 先看关键事实:人名、机构、日期、金额、结论是否和原文一致。
  • 再看引用:实际打开链接,确认页面存在,并包含支持该说法的内容。
  • 区分资料性质:原始公告、研究论文、二手转述和评论不能一概等同。
  • 发现冲突时保留不确定性,不让 AI 为了输出完整而强行选一个答案。

同一个 AI 换句话重复答案,不是独立核验。换一个模型说同样的话,也可能来自相似材料或同一种误解。对于重要决定,应寻找可追溯的原始证据;超出自己能力的专业问题,需要相应专业人士协助。

提示词与知识库能做什么

你可以要求“仅依据所给材料回答”“找不到就说未提及”“把推测单独列出”。这些要求让任务边界更清楚,也便于检查,但不能保证模型始终遵守。

知识库检索可以把相关资料交给模型,减少凭空补全的空间。然而资料本身可能过期,检索可能漏掉例外条款,生成阶段也可能解释错。所以“加了知识库”不是取消人工复核的理由。

不是每个错误都需要用“幻觉”解释。算错加法、没有按格式输出、拒绝了一个合理请求,可能涉及不同问题。先描述具体哪里错、依据是什么,比只贴一个标签更有助于修正。

小练习:让答案留下检查入口

可复制提示词 · 教学示例
只依据下面的虚构通知回答,不使用外部知识。
通知:读书分享会将在周末线上举行,具体时间待定,参与方式稍后公布。
问题:活动什么时候开始?怎样参加?
请分为“原文已确认”和“尚未说明”两部分,并给出对应原句。
不要补全原文没有的信息。

判断结果时,不是看答案有多长,而是看它有没有承认时间和参与方式尚未说明。即使这次答对了,也只说明这道练习通过,不证明以后都不会出错。保留可核对的输入与出处,才能把风险控制落实到每一次使用中。

参考来源

以下资料用于核对概念;正文与练习为本站重新组织的原创讲解,不是外文逐段翻译。

  1. IBM:What are AI hallucinations?

    看似可信但无依据的输出、错误来源与缓解措施;不复制其案例。

    查阅:2026-09-19
  2. Google 机器学习速成课:What's a large language model?

    模型参数、Transformer、注意力与生成的局限;本文不采用参数规模作统一分界。

    查阅:2026-09-19
  3. Google Cloud:What is Retrieval-Augmented Generation?

    检索外部资料辅助生成的基本步骤;不将缓解错误解释为消除错误。

    查阅:2026-09-19