直接答案:AI 幻觉是生成式 AI 自信地给出错误、虚假、无依据、与输入冲突或前后矛盾的内容。它不只表现为“编造事实”,还可能是捏造引用、把过期资料当现状、错误归纳检索材料、算错数字、忽略限制条件,或在智能体中误报工具执行状态。降低风险不能只改一句提示词,而要把问题拆到模型、上下文、知识、工具和业务流程各层,再用来源核验、确定性规则、评测、监控和人工升级共同控制。

AI 幻觉到底是什么
NIST AI 600-1使用 confabulation 描述生成式 AI 面对提示时生成并自信呈现错误或虚假内容的现象,也把偏离输入、与同一上下文中先前陈述矛盾的输出纳入范围。NIST 同时提醒,“hallucination(幻觉)”和“fabrication(编造)”可能让人把人的特征错误投射给系统。中文搜索普遍使用“AI 幻觉”,本文沿用这一名称,但把它当作需要验证的系统输出风险,而不是模型有意识欺骗。
| 判断维度 | 通过条件 | 常见失败 | 核验对象 |
|---|---|---|---|
| 事实正确性 | 人物、时间、数字和事件真实 | 凭空生成不存在的事实 | 一手资料、数据库、原始记录 |
| 输入忠实度 | 结论没有超出给定材料 | 摘要加入原文没有的原因 | 输入片段与逐项主张 |
| 内部一致性 | 前后定义、数字和结论一致 | 同一回答给出两种日期 | 完整会话与中间状态 |
| 时间有效性 | 信息在目标日期仍有效 | 把旧价格、旧版本写成当前 | 发布日期、版本和复核时间 |
| 可追溯性 | 来源确实支持对应结论 | 链接真实但正文不支持主张 | 主张—证据映射 |
“回答听起来合理”不是证据。语言流畅、术语完整、格式专业,只说明输出在表达层面连贯,不说明事实已经通过验证。风险来自用户或下游系统把这种表面确定性当作可靠性,特别是在医疗、法律、财务、安全、生产运维和真实业务动作中。
先区分:并非所有错误都来自模型本身
实际产品是一条链:用户问题进入应用,应用拼接系统指令和历史上下文,可能检索知识库、调用搜索或数据库,再由模型组织答案,最后经过界面、自动化或人工执行。任一环节都可能制造错误。如果知识库过期、检索漏掉关键条款或工具返回失败,换一个更大模型也未必解决。
| 现象 | 更可能的责任层 | 不要急着做 | 优先检查 |
|---|---|---|---|
| 事实完全不存在 | 模型生成/上下文不足 | 仅要求“再想一遍” | 是否允许不知道、是否有可靠来源 |
| 答案引用旧政策 | 知识版本/检索 | 单纯降低温度 | 资料有效期、索引更新时间 |
| 有来源但结论过度 | 证据忠实度/归纳 | 只检查 URL 能否打开 | 来源是否直接支持整句主张 |
| 金额或日期计算错 | 计算工具/参数/解析 | 让模型心算更多步骤 | 原始参数、公式、确定性计算器 |
| 声称邮件已发但实际未发 | 工具状态/智能体编排 | 相信自然语言成功提示 | 工具返回、幂等键、业务回执 |
| 回答偏离用户约束 | 任务定义/上下文冲突 | 把它直接归为事实幻觉 | 优先级、输入截断、条件覆盖 |
这一区分会直接改变修复方案:事实生成错误需要检索、拒答和核验;数据过期需要内容治理;计算错误需要工具;动作误报需要状态机和回执;越权执行属于AI 安全与智能体权限问题。把不同失败压成一个“幻觉率”,会让团队得到无法行动的指标。
AI 幻觉的七种常见类型
| 类型 | 例子 | 主要伤害 | 最有效的第一道检查 |
|---|---|---|---|
| 事实幻觉 | 生成不存在的人、论文、产品功能 | 误导判断与传播 | 查一手来源是否存在 |
| 引用幻觉 | 伪造 DOI、法规条款、网页标题 | 制造虚假权威感 | 打开原文并定位支持段落 |
| 证据错配 | 真实链接只支持部分结论 | 隐蔽且难抽查 | 逐个原子主张对照证据 |
| 时间幻觉 | 把已下线功能写成“目前可用” | 操作失败与采购损失 | 核对版本、发布日期、状态页 |
| 数值幻觉 | 比例相加错误、单位换算错误 | 预算与决策偏差 | 用代码/计算器复算 |
| 上下文幻觉 | 摘要加入材料外原因或结论 | 歪曲原始记录 | 限定只使用输入并逐句回引 |
| 工具/状态幻觉 | 未成功调用却报告完成 | 真实业务动作遗漏 | 以机器回执而非模型话术为准 |
分类不要求互斥。一句“某功能已在 2026 年免费开放,官方文档证明可商用”可能同时包含时间、产品状态、引用和法律边界四类主张。长文本也常混合正确与错误内容,不能用“整篇对/整篇错”的二元标签。FActScore因此把长文本拆成原子事实,再计算其中有多少得到可靠知识源支持;它提供的是细粒度评测思路,不是所有场景通用的自动真相判定器。
为什么生成式 AI 会给出无依据内容
生成模型学习数据中的统计规律,并在给定上下文下生成可能的后续内容。这个目标可以产生准确、有用的答案,却不天然等同于“只输出可被外部证据证明的句子”。NIST 将 confabulation 视为生成方式带来的风险之一,并强调其影响取决于模型、系统和使用场景。对具体一次错误,通常无法仅凭表面输出断言是某个注意力头、潜在空间或温度参数单独造成。
OpenAI 2025 年关于语言模型幻觉的研究说明还指出,只奖励答对、不区分错误回答与合理拒答的评测方式,会鼓励模型在不确定时猜测。这个结论适合用来改造评测激励:分别记录正确、错误和拒答,并让高置信错误的代价高于恰当表达不确定;它不意味着所有具体幻觉都只有一个原因。
| 层级 | 形成条件 | 可观察信号 | 对应控制 |
|---|---|---|---|
| 训练与模型 | 数据含错误、冲突、稀有知识不足 | 特定语言/领域稳定失误 | 模型选择、微调、领域评测 |
| 任务定义 | 问题歧义、成功标准不清 | 不同解释都“像答案” | 澄清问题、声明假设和边界 |
| 上下文 | 关键材料缺失、截断或互相冲突 | 忽略早期约束、张冠李戴 | 上下文管理、冲突检测、引用定位 |
| 检索 | 召回错、排序错、资料过期 | 答案忠实于错误片段 | 检索评测、版本和权限治理 |
| 生成 | 被要求必须回答或补全细节 | 缺证据时仍给精确数字 | 允许拒答、不确定性与证据门禁 |
| 工具 | 参数错误、超时、返回被误读 | 自然语言与真实状态不一致 | schema、重试、回执与状态核验 |
| 使用流程 | 人过度信任、没有复核责任人 | 错误直接进入发布或决策 | 风险分级、审批和可追溯记录 |
温度等采样参数会影响输出的随机性和多样性,但“把温度调低就不再幻觉”不是可靠结论。低随机性可能让同一个错误更稳定地重复;高随机性也可能用于探索、创意或多候选比较。参数必须在具体任务和评测集上验证,不能代替可靠知识、工具结果和业务规则。
普通用户的三分钟核验法
不必逐字查完整回答。先找出“如果错了会改变我的行动”的关键主张,再优先核验。医疗诊断、用药、合同、投资、账号安全、生产命令和对外发布不能只靠三分钟检查,应直接交给合格人员或原始系统确认。
| 步骤 | 要问的问题 | 合格证据 | 危险信号 |
|---|---|---|---|
| 1. 标主张 | 哪些句子包含人、时间、数字、规则或动作? | 可独立判断的一句话 | 一段混合多个结论 |
| 2. 标影响 | 错误会不会造成钱、健康、法律、安全或发布影响? | 明确风险等级 | 所有内容一视同仁 |
| 3. 找一手源 | 谁有权发布这项事实? | 官方文档、法规原文、论文、业务记录 | 聚合站互相转述 |
| 4. 对范围 | 来源支持整句还是只支持一部分? | 对应段落、表格、版本 | 只有首页链接或相似关键词 |
| 5. 查时间 | 在目标日期和版本上仍成立吗? | 发布日期、更新日志、状态页 | 没有日期却写“目前” |
| 6. 再决定 | 证据不足时能否暂停、降级或求助? | 保留不确定与升级路径 | 为了完整而强行补答案 |

需要系统化处理长回答时,使用原子主张—证据忠实度核验框架:先拆句,再分别判断来源存在性、忠实度、覆盖度、充分性和影响。发现某个来源打不开,不等于结论必错;发现链接能打开,也不等于结论已证实。最终状态至少应区分“支持、部分支持、不支持、无法判断、信息过期”。
提示词能降低风险,但不能承担事实保证
好的任务说明可以减少模型为了“看起来完整”而补细节。应明确资料范围、目标日期、输出结构、允许拒答、引用要求和遇到冲突时的处理方式。复杂任务可参考提示词任务规格方法,但提示词仍是自然语言约束,不能替代数据库权限、计算器、交易状态或人工审批。
| 提示要求 | 作用 | 示例 | 边界 |
|---|---|---|---|
| 允许不知道 | 减少被迫补全 | “证据不足时写无法确认” | 模型也可能错误判断证据充分 |
| 限定资料 | 降低无依据外推 | “只根据附件回答” | 附件自身可能错误或被注入 |
| 声明日期 | 暴露时效要求 | “以 2026-07-18 可验证资料为准” | 仍需当前来源 |
| 逐项引用 | 提高可审计性 | “每个关键结论对应原文段落” | 可能引用错配 |
| 分离事实与建议 | 避免意见伪装事实 | “事实、推断、建议分别列出” | 分类结果仍需复核 |
| 先问澄清问题 | 减少歧义 | “版本不明时先询问” | 不能解决缺失知识 |
Anthropic 官方减幻觉指南建议允许模型表达不知道、先从长文中抽取直接引文、让每个主张带引用并在找不到支持时撤回,同时明确关键内容仍需验证。这些做法适合转化为可测的工作流,而不是一句“请不要幻觉”。
联网、RAG 与引用:有证据入口,不等于答案正确
RAG(检索增强生成)把外部文档检索结果加入模型上下文。RAG 原始论文展示了把参数化模型与外部非参数记忆结合的生成方式。它能提供更新或领域知识,但实际质量还取决于知识库是否正确、权限是否合适、召回是否完整、排序是否准确,以及生成内容是否忠实于检索片段。完整工程方法见RAG 检索增强生成指南。
| 环节 | 典型失败 | 离线指标 | 线上证据 |
|---|---|---|---|
| 知识入库 | 过期、重复、无来源文档 | 有效期与来源覆盖率 | 文档版本和所有者 |
| 检索召回 | 关键片段没进入候选 | Recall@k、命中率 | 查询与候选列表 |
| 排序 | 相似但不相关内容靠前 | nDCG、Precision@k | 分数与排序版本 |
| 生成忠实度 | 超出片段、混合多个来源 | 主张支持率、引用精确率 | 主张—片段映射 |
| 权限 | 引用其他租户或角色资料 | 越权负向用例 | 身份与 ACL 判定 |
| 时效 | 新旧政策同时被召回 | 过期命中率 | 生效/失效日期 |
联网搜索也有同样边界:搜索结果可能来自二手文章、营销页、被污染内容或旧缓存。引用必须落到支持结论的具体段落;如果结论需要跨多份资料推断,应明确写“根据这些来源推断”,而不是把推断伪装成某一来源的原话。
结构化输出、函数调用与计算工具分别解决什么
Structured Outputs等 schema 约束能让字段、类型、枚举和必填项符合约定,适合阻止格式漂移;它不保证字段里的姓名、金额或理由真实。函数调用可把计算、查询和业务动作交给确定性工具,但模型仍可能选错工具、传错参数或误读返回。因此需要参数校验、最小权限、幂等、回执和动作后核对。工具设计详见Function Calling 与 Tool Use 指南。
| 方法 | 擅长解决 | 不能保证 | 必须补充 |
|---|---|---|---|
| 结构化输出 | 字段和类型稳定 | 字段值真实 | 值域、来源与业务规则校验 |
| 计算器/代码 | 公式与单位的确定性计算 | 输入参数正确 | 参数来源、范围和复算 |
| 数据库查询 | 读取系统记录 | 查询对象和权限正确 | 身份、SQL/接口约束、时间点 |
| 搜索/RAG | 引入外部知识 | 资料真实、完整且当前 | 来源治理、召回与忠实度评测 |
| 智能体工具 | 执行多步骤任务 | 计划与动作安全 | 审批、预算、超时、回滚和审计 |
智能体中最危险的不是一句错误描述,而是错误描述触发真实动作。部署方案应遵循AI 智能体权限与治理中的最小权限、动作分级和可回滚原则;完整项目还需要在AI 项目生命周期中把数据、评测、发布、观测和退出条件写进门禁。
生产团队怎样建立可用的幻觉评测
不要从“模型总体幻觉率是多少”开始。先写清具体任务、用户、错误类型和损失,再建立代表真实流量的评测集。OpenAI Evaluation Best Practices强调任务特定、持续评测和可比较标准;任何自动裁判都应通过人工样本校准,尤其是领域事实和高风险决策。
| 评测层 | 样本 | 指标 | 发布条件 |
|---|---|---|---|
| 检索 | 问题—应命中文档/片段 | Recall@k、Precision@k、过期命中 | 关键证据不能稳定漏召回 |
| 回答 | 问题—参考答案—允许边界 | 事实正确、完整、相关、拒答 | 高影响错误低于组织阈值 |
| 主张 | 回答—原子主张—支持证据 | 支持/部分/不支持/未知 | 关键主张均可追溯 |
| 引用 | 主张—来源段落 | 引用精确率与覆盖率 | 无伪造来源和关键错配 |
| 工具 | 输入—预期调用—预期状态 | 工具选择、参数、完成回执 | 高风险动作需审批且可回滚 |
| 人机流程 | 界面—警告—复核任务 | 升级率、漏审率、纠正耗时 | 责任人能发现并处置失败 |
SelfCheckGPT研究了在没有外部知识库时,通过同一模型多次采样并比较信息一致性来检测可能的幻觉。这个思路可以成为弱信号:多个答案互相冲突值得复查;但多个答案一致也可能共同重复同一错误,所以一致性不能当作事实证明。
上线门禁:把防线放在完整系统而不是最后一段提示词

| 门禁 | 最低要求 | 失败处理 | 留存证据 |
|---|---|---|---|
| 任务门禁 | 定义允许回答、拒答和人工升级范围 | 范围外不自动完成 | 任务规格与版本 |
| 知识门禁 | 来源、所有者、有效期和权限明确 | 下线过期/无权文档 | 知识清单与变更记录 |
| 输出门禁 | schema、规则、引用和敏感字段检查 | 阻断、降级或请求澄清 | 检查结果与原始输出 |
| 动作门禁 | 高风险工具需审批、预算和幂等 | 暂停、撤销、回滚 | 调用参数与业务回执 |
| 评测门禁 | 版本变更跑固定集和新失败集 | 不发布或灰度回退 | 模型/提示/检索配置与得分 |
| 运营门禁 | 抽检、投诉、异常与纠错闭环 | 隐藏错误答案、通知受影响者 | 事件与纠错记录 |
监控不能只看“用户点赞率”。用户可能没有发现错误,也可能因为答案顺耳而点赞。线上至少记录任务类型、模型和提示版本、检索文档版本、引用、工具参数与结果、验证器状态、人工改动和最终动作;敏感数据应脱敏并按权限、保留期管理。错误样本进入回归集后,下一次模型、提示、索引或工具更新都要重测。
哪些场景必须人工升级
| 场景 | 不能只靠 AI 的原因 | 最低升级动作 | 禁止自动化 |
|---|---|---|---|
| 医疗与健康 | 个体差异和错误建议可能伤害身体 | 执业专业人员与原始检查资料 | 自行诊断、改药、急症延误 |
| 法律与合规 | 法域、事实和时点决定结论 | 适用法原文与合格专业人员 | 虚构判例后直接提交 |
| 财务与投资 | 数据时效和风险承受能力不同 | 原始披露、账户记录、专业建议 | 仅凭生成答案交易 |
| 网络与生产安全 | 命令和权限可造成真实破坏 | 沙箱、变更审批、备份和回滚 | 未经审查执行生成命令 |
| 新闻与公共信息 | 错误传播会放大且难撤回 | 多源核验、署名编辑、纠错机制 | 无来源批量发布 |
| 招聘、信贷等权益决策 | 偏差与错误影响个人机会 | 合法依据、人工复核和申诉 | 黑箱自动拒绝 |
人工复核也不是“看一眼”。复核者需要看到原始问题、关键输入、模型版本、证据、计算过程、工具回执和风险等级,并有权暂停流程。没有材料、时间或能力的人工签字只是责任转移,不是有效控制。
常见误区:这些办法为什么不能单独成立
| 误区 | 问题 | 正确用法 |
|---|---|---|
| “最新模型就不会幻觉” | 能力提升不等于所有任务零错误 | 按自己的数据和风险持续评测 |
| “把温度设为 0 就准确” | 稳定输出也可能稳定地错 | 把参数作为任务级实验变量 |
| “有引用就是真的” | 引用可能伪造、错配或过期 | 检查来源存在、范围、时效和充分性 |
| “RAG 已解决幻觉” | 检索、知识和生成各自仍会失败 | 分别评测召回、忠实度与权限 |
| “多问几次多数票是真相” | 多个样本可能共享同一错误 | 把不一致当预警,回到外部证据 |
| “人工在环即可” | 人可能自动化偏见、缺时间或缺材料 | 定义责任、证据界面和升级权限 |
| “结构化 JSON 就可靠” | 格式正确与事实正确是两件事 | schema 后继续做值和来源校验 |
小团队的最小可行实施清单
资源有限时,不要先购买一个宣称“自动消除幻觉”的平台。先选出一个明确任务,收集真实问题和已发现错误,建立小而可审查的基准集;为每个高影响答案保存来源和版本;把计算、查询和动作交给受限工具;在发布或执行前设置阻断与人工升级。每次发现新错误,都要同时修正当前结果并把样本加入回归集。
| 本周可完成 | 交付物 | 验收问题 |
|---|---|---|
| 定义一个任务 | 输入、输出、拒答、风险边界 | 团队能否判断什么不该自动回答? |
| 收集 30—50 条真实样本 | 正常、边界、过期、冲突和失败样本 | 是否来自真实使用而非只由模型生成? |
| 标记关键主张 | 参考来源、允许范围与风险等级 | 高影响结论是否能落到一手证据? |
| 设置三个硬门禁 | 无证据拒答、数值复算、高风险审批 | 门禁失败时系统是否真的停止? |
| 保存版本与结果 | 模型、提示、知识、工具和评测记录 | 下次更新能否复现并比较? |
基准集数量不是质量证明。样本应覆盖用户语言、资料长度、时间敏感问题、否定条件、相似实体、单位换算、资料冲突和工具失败,并由懂业务的人审查。自动评分适合扩大覆盖,人工复核负责校准评分标准和处理高风险分歧。
FAQ:关于 AI 幻觉的高频问题
AI 幻觉等于撒谎吗?
不等于。撒谎通常包含主体知道真相并有意误导的含义;生成模型是在给定上下文下生成输出。讨论工程风险时,关注内容是否错误、无依据、前后矛盾以及会造成什么后果,比推测“它是否有意”更有操作价值。
能不能准确计算一个模型的幻觉率?
可以在明确任务、样本、时间、评分规则和证据集上测得一个指标,但不能脱离这些条件给出永久通用的单一数字。问答、摘要、代码、RAG 和工具调用的错误定义不同;同一模型在不同语言、领域和版本上也会变化。
模型说“我不确定”就安全吗?
不确定性表达是有用信号,但模型可能对正确内容过度犹豫,也可能对错误内容非常自信。是否允许继续行动,应由证据和风险规则决定,而不是只看语气。
引用越多,回答越可靠吗?
不一定。数量不能替代质量。更重要的是关键主张是否由适当的一手来源直接支持、引用是否覆盖完整结论、资料是否仍有效,以及相互冲突的证据是否被说明。
个人用户最重要的一条习惯是什么?
在采取行动前,先找出最关键、最可能造成损失的一条主张,回到有权发布它的一手来源核验。证据不足就暂停,不要为了得到完整答案而让 AI 补齐未知信息。
来源与复核记录
- NIST:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile(AI 600-1)——定义 confabulation、说明风险范围与生成式 AI 生命周期治理;出版页显示 2026-04-08 更新。
- TruthfulQA: Measuring How Models Mimic Human Falsehoods——817 个问题、38 个类别的真实性基准;本文不外推其旧模型分数。
- FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation——原子事实与可靠来源支持比例的细粒度评测。
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks——RAG 原始研究,用于说明参数化与外部记忆组合,不作为“消除幻觉”的证明。
- SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models——多次采样一致性检测思路及其适用边界。
- Anthropic:Reduce hallucinations——不确定性、直接引文、逐项引用与关键内容人工验证。
- OpenAI:Structured Outputs——用于 schema 约束,不作为事实正确性保证。
- OpenAI:Evaluation Best Practices——任务特定评测、数据集、标准与持续评估。
- OpenAI:语言模型为何会产生幻觉——用于说明只奖励准确率可能鼓励猜测,以及应区分正确、错误与拒答;不外推为单一根因。
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 19 日复核。旧稿中把幻觉简单归因于注意力分散、潜在空间插值和高温度,并残留 Markdown;新版删除无法由来源支持的机理断言,新增错误分类、个人核验、RAG/工具边界、生产评测、上线门禁与高风险升级。本轮把错误类型特色图纳入正文首屏,并重新执行品牌、Markdown、视觉授权和文章结构门禁。本站来源、更新和纠错原则见关于本站与编辑规范。
