AI概念与词典

AI 幻觉是什么?类型、核验方法与生产级风险控制指南

AI幻觉不只是模型编造事实,还可能来自过期知识、检索错配、计算错误和工具状态误报。本文提供错误分类、三分钟核验法、RAG边界、评测指标、上线门禁与人工升级清单。

AI回答中的事实错误、引用错配、知识过期、检索失败、计算错误、指令偏离和工具状态错误分类图
本页目录
  1. AI 幻觉到底是什么
  2. 先区分:并非所有错误都来自模型本身
  3. AI 幻觉的七种常见类型
  4. 为什么生成式 AI 会给出无依据内容
  5. 普通用户的三分钟核验法
  6. 提示词能降低风险,但不能承担事实保证
  7. 联网、RAG 与引用:有证据入口,不等于答案正确
  8. 结构化输出、函数调用与计算工具分别解决什么
  9. 生产团队怎样建立可用的幻觉评测
  10. 上线门禁:把防线放在完整系统而不是最后一段提示词
  11. 哪些场景必须人工升级
  12. 常见误区:这些办法为什么不能单独成立
  13. 小团队的最小可行实施清单
  14. FAQ:关于 AI 幻觉的高频问题
  15. AI 幻觉等于撒谎吗?
  16. 能不能准确计算一个模型的幻觉率?
  17. 模型说“我不确定”就安全吗?
  18. 引用越多,回答越可靠吗?
  19. 个人用户最重要的一条习惯是什么?
  20. 来源与复核记录

直接答案:AI 幻觉是生成式 AI 自信地给出错误、虚假、无依据、与输入冲突或前后矛盾的内容。它不只表现为“编造事实”,还可能是捏造引用、把过期资料当现状、错误归纳检索材料、算错数字、忽略限制条件,或在智能体中误报工具执行状态。降低风险不能只改一句提示词,而要把问题拆到模型、上下文、知识、工具和业务流程各层,再用来源核验、确定性规则、评测、监控和人工升级共同控制。

AI 幻觉按事实引用时间检索计算与工具状态错误定位责任层和控制方法
“回答不对”不是一个足够具体的问题:先判断错误属于事实、证据、时效、检索、计算还是工具状态,再选择核验与控制。图:兰塞 AI 编辑部原创。
编辑更正(2026-07-18):旧稿把大模型简化为“文字接龙高手”,并把注意力分散、潜在空间插值和高温度直接写成通用根因,缺少可核验来源且残留 Markdown。新版删除这些过度确定的机理断言,按 NIST AI 600-1、官方工程文档与同行评审研究重建。本文不承诺任何模型、RAG、联网、引用或提示词能彻底消除幻觉。

AI 幻觉到底是什么

NIST AI 600-1使用 confabulation 描述生成式 AI 面对提示时生成并自信呈现错误或虚假内容的现象,也把偏离输入、与同一上下文中先前陈述矛盾的输出纳入范围。NIST 同时提醒,“hallucination(幻觉)”和“fabrication(编造)”可能让人把人的特征错误投射给系统。中文搜索普遍使用“AI 幻觉”,本文沿用这一名称,但把它当作需要验证的系统输出风险,而不是模型有意识欺骗。

判断维度 通过条件 常见失败 核验对象
事实正确性 人物、时间、数字和事件真实 凭空生成不存在的事实 一手资料、数据库、原始记录
输入忠实度 结论没有超出给定材料 摘要加入原文没有的原因 输入片段与逐项主张
内部一致性 前后定义、数字和结论一致 同一回答给出两种日期 完整会话与中间状态
时间有效性 信息在目标日期仍有效 把旧价格、旧版本写成当前 发布日期、版本和复核时间
可追溯性 来源确实支持对应结论 链接真实但正文不支持主张 主张—证据映射

“回答听起来合理”不是证据。语言流畅、术语完整、格式专业,只说明输出在表达层面连贯,不说明事实已经通过验证。风险来自用户或下游系统把这种表面确定性当作可靠性,特别是在医疗、法律、财务、安全、生产运维和真实业务动作中。

先区分:并非所有错误都来自模型本身

实际产品是一条链:用户问题进入应用,应用拼接系统指令和历史上下文,可能检索知识库、调用搜索或数据库,再由模型组织答案,最后经过界面、自动化或人工执行。任一环节都可能制造错误。如果知识库过期、检索漏掉关键条款或工具返回失败,换一个更大模型也未必解决。

现象 更可能的责任层 不要急着做 优先检查
事实完全不存在 模型生成/上下文不足 仅要求“再想一遍” 是否允许不知道、是否有可靠来源
答案引用旧政策 知识版本/检索 单纯降低温度 资料有效期、索引更新时间
有来源但结论过度 证据忠实度/归纳 只检查 URL 能否打开 来源是否直接支持整句主张
金额或日期计算错 计算工具/参数/解析 让模型心算更多步骤 原始参数、公式、确定性计算器
声称邮件已发但实际未发 工具状态/智能体编排 相信自然语言成功提示 工具返回、幂等键、业务回执
回答偏离用户约束 任务定义/上下文冲突 把它直接归为事实幻觉 优先级、输入截断、条件覆盖

这一区分会直接改变修复方案:事实生成错误需要检索、拒答和核验;数据过期需要内容治理;计算错误需要工具;动作误报需要状态机和回执;越权执行属于AI 安全与智能体权限问题。把不同失败压成一个“幻觉率”,会让团队得到无法行动的指标。

AI 幻觉的七种常见类型

类型 例子 主要伤害 最有效的第一道检查
事实幻觉 生成不存在的人、论文、产品功能 误导判断与传播 查一手来源是否存在
引用幻觉 伪造 DOI、法规条款、网页标题 制造虚假权威感 打开原文并定位支持段落
证据错配 真实链接只支持部分结论 隐蔽且难抽查 逐个原子主张对照证据
时间幻觉 把已下线功能写成“目前可用” 操作失败与采购损失 核对版本、发布日期、状态页
数值幻觉 比例相加错误、单位换算错误 预算与决策偏差 用代码/计算器复算
上下文幻觉 摘要加入材料外原因或结论 歪曲原始记录 限定只使用输入并逐句回引
工具/状态幻觉 未成功调用却报告完成 真实业务动作遗漏 以机器回执而非模型话术为准

分类不要求互斥。一句“某功能已在 2026 年免费开放,官方文档证明可商用”可能同时包含时间、产品状态、引用和法律边界四类主张。长文本也常混合正确与错误内容,不能用“整篇对/整篇错”的二元标签。FActScore因此把长文本拆成原子事实,再计算其中有多少得到可靠知识源支持;它提供的是细粒度评测思路,不是所有场景通用的自动真相判定器。

为什么生成式 AI 会给出无依据内容

生成模型学习数据中的统计规律,并在给定上下文下生成可能的后续内容。这个目标可以产生准确、有用的答案,却不天然等同于“只输出可被外部证据证明的句子”。NIST 将 confabulation 视为生成方式带来的风险之一,并强调其影响取决于模型、系统和使用场景。对具体一次错误,通常无法仅凭表面输出断言是某个注意力头、潜在空间或温度参数单独造成。

OpenAI 2025 年关于语言模型幻觉的研究说明还指出,只奖励答对、不区分错误回答与合理拒答的评测方式,会鼓励模型在不确定时猜测。这个结论适合用来改造评测激励:分别记录正确、错误和拒答,并让高置信错误的代价高于恰当表达不确定;它不意味着所有具体幻觉都只有一个原因。

层级 形成条件 可观察信号 对应控制
训练与模型 数据含错误、冲突、稀有知识不足 特定语言/领域稳定失误 模型选择、微调、领域评测
任务定义 问题歧义、成功标准不清 不同解释都“像答案” 澄清问题、声明假设和边界
上下文 关键材料缺失、截断或互相冲突 忽略早期约束、张冠李戴 上下文管理、冲突检测、引用定位
检索 召回错、排序错、资料过期 答案忠实于错误片段 检索评测、版本和权限治理
生成 被要求必须回答或补全细节 缺证据时仍给精确数字 允许拒答、不确定性与证据门禁
工具 参数错误、超时、返回被误读 自然语言与真实状态不一致 schema、重试、回执与状态核验
使用流程 人过度信任、没有复核责任人 错误直接进入发布或决策 风险分级、审批和可追溯记录

温度等采样参数会影响输出的随机性和多样性,但“把温度调低就不再幻觉”不是可靠结论。低随机性可能让同一个错误更稳定地重复;高随机性也可能用于探索、创意或多候选比较。参数必须在具体任务和评测集上验证,不能代替可靠知识、工具结果和业务规则。

普通用户的三分钟核验法

不必逐字查完整回答。先找出“如果错了会改变我的行动”的关键主张,再优先核验。医疗诊断、用药、合同、投资、账号安全、生产命令和对外发布不能只靠三分钟检查,应直接交给合格人员或原始系统确认。

步骤 要问的问题 合格证据 危险信号
1. 标主张 哪些句子包含人、时间、数字、规则或动作? 可独立判断的一句话 一段混合多个结论
2. 标影响 错误会不会造成钱、健康、法律、安全或发布影响? 明确风险等级 所有内容一视同仁
3. 找一手源 谁有权发布这项事实? 官方文档、法规原文、论文、业务记录 聚合站互相转述
4. 对范围 来源支持整句还是只支持一部分? 对应段落、表格、版本 只有首页链接或相似关键词
5. 查时间 在目标日期和版本上仍成立吗? 发布日期、更新日志、状态页 没有日期却写“目前”
6. 再决定 证据不足时能否暂停、降级或求助? 保留不确定与升级路径 为了完整而强行补答案
AI回答从原子主张提取到来源匹配证据忠实度覆盖度风险决定和审计记录的核验流程
核验对象不是“这段话像不像真的”,而是每个会影响决策的主张是否有匹配、足够、有效期正确的证据。图:兰塞 AI 编辑部原创。

需要系统化处理长回答时,使用原子主张—证据忠实度核验框架:先拆句,再分别判断来源存在性、忠实度、覆盖度、充分性和影响。发现某个来源打不开,不等于结论必错;发现链接能打开,也不等于结论已证实。最终状态至少应区分“支持、部分支持、不支持、无法判断、信息过期”。

提示词能降低风险,但不能承担事实保证

好的任务说明可以减少模型为了“看起来完整”而补细节。应明确资料范围、目标日期、输出结构、允许拒答、引用要求和遇到冲突时的处理方式。复杂任务可参考提示词任务规格方法,但提示词仍是自然语言约束,不能替代数据库权限、计算器、交易状态或人工审批。

提示要求 作用 示例 边界
允许不知道 减少被迫补全 “证据不足时写无法确认” 模型也可能错误判断证据充分
限定资料 降低无依据外推 “只根据附件回答” 附件自身可能错误或被注入
声明日期 暴露时效要求 “以 2026-07-18 可验证资料为准” 仍需当前来源
逐项引用 提高可审计性 “每个关键结论对应原文段落” 可能引用错配
分离事实与建议 避免意见伪装事实 “事实、推断、建议分别列出” 分类结果仍需复核
先问澄清问题 减少歧义 “版本不明时先询问” 不能解决缺失知识

Anthropic 官方减幻觉指南建议允许模型表达不知道、先从长文中抽取直接引文、让每个主张带引用并在找不到支持时撤回,同时明确关键内容仍需验证。这些做法适合转化为可测的工作流,而不是一句“请不要幻觉”。

联网、RAG 与引用:有证据入口,不等于答案正确

RAG(检索增强生成)把外部文档检索结果加入模型上下文。RAG 原始论文展示了把参数化模型与外部非参数记忆结合的生成方式。它能提供更新或领域知识,但实际质量还取决于知识库是否正确、权限是否合适、召回是否完整、排序是否准确,以及生成内容是否忠实于检索片段。完整工程方法见RAG 检索增强生成指南

环节 典型失败 离线指标 线上证据
知识入库 过期、重复、无来源文档 有效期与来源覆盖率 文档版本和所有者
检索召回 关键片段没进入候选 Recall@k、命中率 查询与候选列表
排序 相似但不相关内容靠前 nDCG、Precision@k 分数与排序版本
生成忠实度 超出片段、混合多个来源 主张支持率、引用精确率 主张—片段映射
权限 引用其他租户或角色资料 越权负向用例 身份与 ACL 判定
时效 新旧政策同时被召回 过期命中率 生效/失效日期

联网搜索也有同样边界:搜索结果可能来自二手文章、营销页、被污染内容或旧缓存。引用必须落到支持结论的具体段落;如果结论需要跨多份资料推断,应明确写“根据这些来源推断”,而不是把推断伪装成某一来源的原话。

结构化输出、函数调用与计算工具分别解决什么

Structured Outputs等 schema 约束能让字段、类型、枚举和必填项符合约定,适合阻止格式漂移;它不保证字段里的姓名、金额或理由真实。函数调用可把计算、查询和业务动作交给确定性工具,但模型仍可能选错工具、传错参数或误读返回。因此需要参数校验、最小权限、幂等、回执和动作后核对。工具设计详见Function Calling 与 Tool Use 指南

方法 擅长解决 不能保证 必须补充
结构化输出 字段和类型稳定 字段值真实 值域、来源与业务规则校验
计算器/代码 公式与单位的确定性计算 输入参数正确 参数来源、范围和复算
数据库查询 读取系统记录 查询对象和权限正确 身份、SQL/接口约束、时间点
搜索/RAG 引入外部知识 资料真实、完整且当前 来源治理、召回与忠实度评测
智能体工具 执行多步骤任务 计划与动作安全 审批、预算、超时、回滚和审计

智能体中最危险的不是一句错误描述,而是错误描述触发真实动作。部署方案应遵循AI 智能体权限与治理中的最小权限、动作分级和可回滚原则;完整项目还需要在AI 项目生命周期中把数据、评测、发布、观测和退出条件写进门禁。

生产团队怎样建立可用的幻觉评测

不要从“模型总体幻觉率是多少”开始。先写清具体任务、用户、错误类型和损失,再建立代表真实流量的评测集。OpenAI Evaluation Best Practices强调任务特定、持续评测和可比较标准;任何自动裁判都应通过人工样本校准,尤其是领域事实和高风险决策。

评测层 样本 指标 发布条件
检索 问题—应命中文档/片段 Recall@k、Precision@k、过期命中 关键证据不能稳定漏召回
回答 问题—参考答案—允许边界 事实正确、完整、相关、拒答 高影响错误低于组织阈值
主张 回答—原子主张—支持证据 支持/部分/不支持/未知 关键主张均可追溯
引用 主张—来源段落 引用精确率与覆盖率 无伪造来源和关键错配
工具 输入—预期调用—预期状态 工具选择、参数、完成回执 高风险动作需审批且可回滚
人机流程 界面—警告—复核任务 升级率、漏审率、纠正耗时 责任人能发现并处置失败

SelfCheckGPT研究了在没有外部知识库时,通过同一模型多次采样并比较信息一致性来检测可能的幻觉。这个思路可以成为弱信号:多个答案互相冲突值得复查;但多个答案一致也可能共同重复同一错误,所以一致性不能当作事实证明。

上线门禁:把防线放在完整系统而不是最后一段提示词

AI幻觉从任务定义可靠知识检索工具验证离线评测线上监控人工升级到纠错恢复的控制栈
可控目标不是“零幻觉口号”,而是让错误更少、更早被发现、不能越权行动,并能纠正和追溯。图:兰塞 AI 编辑部原创。
门禁 最低要求 失败处理 留存证据
任务门禁 定义允许回答、拒答和人工升级范围 范围外不自动完成 任务规格与版本
知识门禁 来源、所有者、有效期和权限明确 下线过期/无权文档 知识清单与变更记录
输出门禁 schema、规则、引用和敏感字段检查 阻断、降级或请求澄清 检查结果与原始输出
动作门禁 高风险工具需审批、预算和幂等 暂停、撤销、回滚 调用参数与业务回执
评测门禁 版本变更跑固定集和新失败集 不发布或灰度回退 模型/提示/检索配置与得分
运营门禁 抽检、投诉、异常与纠错闭环 隐藏错误答案、通知受影响者 事件与纠错记录

监控不能只看“用户点赞率”。用户可能没有发现错误,也可能因为答案顺耳而点赞。线上至少记录任务类型、模型和提示版本、检索文档版本、引用、工具参数与结果、验证器状态、人工改动和最终动作;敏感数据应脱敏并按权限、保留期管理。错误样本进入回归集后,下一次模型、提示、索引或工具更新都要重测。

哪些场景必须人工升级

场景 不能只靠 AI 的原因 最低升级动作 禁止自动化
医疗与健康 个体差异和错误建议可能伤害身体 执业专业人员与原始检查资料 自行诊断、改药、急症延误
法律与合规 法域、事实和时点决定结论 适用法原文与合格专业人员 虚构判例后直接提交
财务与投资 数据时效和风险承受能力不同 原始披露、账户记录、专业建议 仅凭生成答案交易
网络与生产安全 命令和权限可造成真实破坏 沙箱、变更审批、备份和回滚 未经审查执行生成命令
新闻与公共信息 错误传播会放大且难撤回 多源核验、署名编辑、纠错机制 无来源批量发布
招聘、信贷等权益决策 偏差与错误影响个人机会 合法依据、人工复核和申诉 黑箱自动拒绝

人工复核也不是“看一眼”。复核者需要看到原始问题、关键输入、模型版本、证据、计算过程、工具回执和风险等级,并有权暂停流程。没有材料、时间或能力的人工签字只是责任转移,不是有效控制。

常见误区:这些办法为什么不能单独成立

误区 问题 正确用法
“最新模型就不会幻觉” 能力提升不等于所有任务零错误 按自己的数据和风险持续评测
“把温度设为 0 就准确” 稳定输出也可能稳定地错 把参数作为任务级实验变量
“有引用就是真的” 引用可能伪造、错配或过期 检查来源存在、范围、时效和充分性
“RAG 已解决幻觉” 检索、知识和生成各自仍会失败 分别评测召回、忠实度与权限
“多问几次多数票是真相” 多个样本可能共享同一错误 把不一致当预警,回到外部证据
“人工在环即可” 人可能自动化偏见、缺时间或缺材料 定义责任、证据界面和升级权限
“结构化 JSON 就可靠” 格式正确与事实正确是两件事 schema 后继续做值和来源校验

小团队的最小可行实施清单

资源有限时,不要先购买一个宣称“自动消除幻觉”的平台。先选出一个明确任务,收集真实问题和已发现错误,建立小而可审查的基准集;为每个高影响答案保存来源和版本;把计算、查询和动作交给受限工具;在发布或执行前设置阻断与人工升级。每次发现新错误,都要同时修正当前结果并把样本加入回归集。

本周可完成 交付物 验收问题
定义一个任务 输入、输出、拒答、风险边界 团队能否判断什么不该自动回答?
收集 30—50 条真实样本 正常、边界、过期、冲突和失败样本 是否来自真实使用而非只由模型生成?
标记关键主张 参考来源、允许范围与风险等级 高影响结论是否能落到一手证据?
设置三个硬门禁 无证据拒答、数值复算、高风险审批 门禁失败时系统是否真的停止?
保存版本与结果 模型、提示、知识、工具和评测记录 下次更新能否复现并比较?

基准集数量不是质量证明。样本应覆盖用户语言、资料长度、时间敏感问题、否定条件、相似实体、单位换算、资料冲突和工具失败,并由懂业务的人审查。自动评分适合扩大覆盖,人工复核负责校准评分标准和处理高风险分歧。

FAQ:关于 AI 幻觉的高频问题

AI 幻觉等于撒谎吗?

不等于。撒谎通常包含主体知道真相并有意误导的含义;生成模型是在给定上下文下生成输出。讨论工程风险时,关注内容是否错误、无依据、前后矛盾以及会造成什么后果,比推测“它是否有意”更有操作价值。

能不能准确计算一个模型的幻觉率?

可以在明确任务、样本、时间、评分规则和证据集上测得一个指标,但不能脱离这些条件给出永久通用的单一数字。问答、摘要、代码、RAG 和工具调用的错误定义不同;同一模型在不同语言、领域和版本上也会变化。

模型说“我不确定”就安全吗?

不确定性表达是有用信号,但模型可能对正确内容过度犹豫,也可能对错误内容非常自信。是否允许继续行动,应由证据和风险规则决定,而不是只看语气。

引用越多,回答越可靠吗?

不一定。数量不能替代质量。更重要的是关键主张是否由适当的一手来源直接支持、引用是否覆盖完整结论、资料是否仍有效,以及相互冲突的证据是否被说明。

个人用户最重要的一条习惯是什么?

在采取行动前,先找出最关键、最可能造成损失的一条主张,回到有权发布它的一手来源核验。证据不足就暂停,不要为了得到完整答案而让 AI 补齐未知信息。

来源与复核记录

  1. NIST:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile(AI 600-1)——定义 confabulation、说明风险范围与生成式 AI 生命周期治理;出版页显示 2026-04-08 更新。
  2. TruthfulQA: Measuring How Models Mimic Human Falsehoods——817 个问题、38 个类别的真实性基准;本文不外推其旧模型分数。
  3. FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation——原子事实与可靠来源支持比例的细粒度评测。
  4. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks——RAG 原始研究,用于说明参数化与外部记忆组合,不作为“消除幻觉”的证明。
  5. SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models——多次采样一致性检测思路及其适用边界。
  6. Anthropic:Reduce hallucinations——不确定性、直接引文、逐项引用与关键内容人工验证。
  7. OpenAI:Structured Outputs——用于 schema 约束,不作为事实正确性保证。
  8. OpenAI:Evaluation Best Practices——任务特定评测、数据集、标准与持续评估。
  9. OpenAI:语言模型为何会产生幻觉——用于说明只奖励准确率可能鼓励猜测,以及应区分正确、错误与拒答;不外推为单一根因。

编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 19 日复核。旧稿中把幻觉简单归因于注意力分散、潜在空间插值和高温度,并残留 Markdown;新版删除无法由来源支持的机理断言,新增错误分类、个人核验、RAG/工具边界、生产评测、上线门禁与高风险升级。本轮把错误类型特色图纳入正文首屏,并重新执行品牌、Markdown、视觉授权和文章结构门禁。本站来源、更新和纠错原则见关于本站与编辑规范