直接答案:AI 内容审核不是让一个大模型替平台判断“能不能发”,也不是追求脱离类别、分母和阈值的“96.5% 总准确率”。可上线的系统需要先把平台规则转成可标注的类别、严重度与处置,再用确定性规则和分类模型分层筛查,将高风险、语境复杂和不确定样本交给经过培训的人工复核,同时保留申诉、回滚、监控与版本化评测。

本文面向运营用户生成内容、评论、商品信息、社区、直播、客服或生成式 AI 输出的平台团队,资料复核日期为 2026 年 7 月 16 日。旧稿中的“A 平台”、日增 500 万条内容、36% 漏检、12% 误杀、200 人团队、96.5% 准确率和成本降低 65% 均无可核验来源,本次改写已全部删除。
先区分:内容审核、内容安全与 AI 输出护栏
三个概念经常被混用。内容审核决定平台内容是否允许发布、降权、限制或删除;内容安全还包括账号、未成年人、欺诈、隐私、版权、事件处置等更广范围;AI 输出护栏则重点处理用户提示、模型回答、工具调用和检索内容。它们有交集,但不能使用同一套标签和阈值。
| 系统 | 主要输入 | 典型决定 | 不能替代 |
|---|---|---|---|
| UGC 内容审核 | 帖子、评论、商品、图片、音视频 | 通过、限流、年龄限制、人工复核、删除 | 账号风控、真实违法判断和用户救济 |
| 生成式 AI 输入审核 | 提示词、附件、检索文档 | 允许、拒绝、缩小任务、隔离工具 | 模型输出事实核验 |
| 生成式 AI 输出审核 | 模型回答、图片、代码、引用 | 重写、阻断、提示、人工确认 | 数据权限和工具授权 |
| 内容标识 | AI 生成的文本、图片、音频、视频 | 显式提示、元数据标识 | 审核内容是否合法、真实或获得授权 |
| 账号与行为风控 | 发布频率、设备、关系、资金和异常动作 | 验证码、限速、冻结、调查 | 单条内容语义判断 |
《网络信息内容生态治理规定》将网络信息内容生产者、服务平台、使用者和行业组织纳入治理体系。对于深度合成服务,《互联网信息服务深度合成管理规定》还要求服务提供者采取技术或人工方式审核输入数据和合成结果,建立特征库、保存日志,并设置用户申诉和公众投诉举报入口。
第一步:把“违规内容”改写成可执行政策
审核失败往往不是模型不够大,而是规则只写“低俗”“不友善”“高风险”,没有说明对象、严重度、语境和处置。标注员、模型、运营和申诉团队会各自理解,最终得出的准确率没有可比性。
| 政策字段 | 需要回答 | 合格示例方向 | 不合格写法 |
|---|---|---|---|
| 类别 | 审核的具体风险是什么? | 人身威胁、诈骗引流、个人信息暴露 | 不良内容 |
| 对象 | 针对谁、什么资产或行为? | 明确个人、受保护群体、未成年人、账号凭据 | 影响不好 |
| 严重度 | 什么条件使风险升级? | 一般辱骂、持续骚扰、具体可信威胁分别定义 | 轻微/严重但无判断条件 |
| 语境 | 引用、新闻、教育、反对性讨论如何处理? | 保存上下文并判断是否支持、谴责或实施伤害 | 只要出现关键词就删除 |
| 处置 | 每个等级做什么? | 通过、提示、年龄限制、降权、复核、删除、升级 | 违规就封号 |
| 例外与申诉 | 谁能批准例外,用户如何纠正? | 记录批准人、时限、恢复动作和政策版本 | 人工酌情处理 |
政策还要标明适用产品、地区、年龄和发布时间。面向中国境内公众提供生成式 AI 服务时,应结合《生成式人工智能服务管理暂行办法》核对提供者责任、输入记录保护、违法内容处置、投诉举报和备案/安全评估等要求;企业内部辅助工具不应被不加区分地套用为同一义务。
第二步:为什么规则、专用分类器和大模型要分层?
不同检测器擅长不同任务。确定格式的密钥、号码和已知哈希适合规则;明确类别和大量标注数据适合专用分类器;需要跨句、图文或会话语境的疑难样本可以交给多模态模型或人工。让大模型处理全部内容通常带来更高成本、延迟、版本漂移和难以解释的边界。
| 层级 | 适合任务 | 优势 | 主要风险 | 正确位置 |
|---|---|---|---|---|
| 允许/禁止清单 | 可信来源、明确文件类型和已知实体 | 结果稳定、容易解释 | 清单过期、被变形绕过 | 入口和资源权限 |
| 规则与哈希 | 号码、密钥、URL、重复文件、已确认样本 | 低延迟、可审计 | 缺少上下文、误报 | 快速预筛 |
| 专用分类模型 | 固定风险类别和严重度 | 吞吐高、阈值可调 | 语言、领域和数据漂移 | 批量评分 |
| 大模型/多模态模型 | 复杂语境、跨模态和政策解释 | 覆盖长尾表达 | 不稳定、提示注入、成本与延迟 | 疑难样本辅助 |
| 人工复核 | 高影响、不确定、申诉和新类别 | 结合语境与责任判断 | 疲劳、二次伤害和不一致 | 最终责任节点 |
供应商 API 只能提供信号。OpenAI Moderations API会按其当前模型返回类别、是否标记和类别分数;Azure AI Content Safety提供文本、图片、提示攻击和自定义类别等能力;Google Cloud 文本审核返回安全属性及置信度。三者类别、语言、阈值和适用范围不完全相同,不能把一个接口的分数直接翻译成平台法律结论。
第三步:如何建立自己的内容分类体系?
平台分类应从实际风险和处置开始,而不是复制供应商标签。一个商品平台可能更关注违禁品、虚假宣传、联系方式导流和商标;社区更关注骚扰、威胁、仇恨、自伤和未成年人;企业助手则更关注敏感信息、越权工具和危险指令。
| 分类层 | 作用 | 示例 | 版本要求 |
|---|---|---|---|
| 政策域 | 对应责任团队和总规则 | 人身安全、隐私、欺诈、知识产权 | 记录适用地区与产品 |
| 风险类别 | 供模型和标注使用 | 具体威胁、账号凭据暴露、仿冒引流 | 定义正例、反例和边界 |
| 严重度 | 决定处置强度 | S0 正常、S1 提示、S2 复核、S3 阻断升级 | 必须写升级条件 |
| 语境标签 | 减少引用和反对性讨论误杀 | 新闻报道、教育、虚构、谴责、求助 | 不自动覆盖高风险事实 |
| 处置码 | 连接审核与产品动作 | 允许、警示、年龄门、限流、删除、账号调查 | 支持撤销和申诉恢复 |
涉及个人信息时,审核系统本身也会处理帖子、聊天、举报、账号和审核员记录。应参考个人信息保护法控制处理目的、范围、权限和保留期限,不能因为“为了安全”就无限期保存全部原始内容。数据路径与供应商边界可衔接站内企业 AI 数据合规指南。
第四步:标注集怎样做才不会把偏见写进模型?
标注指南应包含每类定义、正例、反例、临界样本、语境、严重度和处置。至少两名标注员独立处理一部分重叠样本,再由资深人员裁决分歧。分歧不是“标注员不认真”的证据,往往暴露政策本身含糊。
| 样本集合 | 目的 | 来源要求 | 常见污染 |
|---|---|---|---|
| 训练集 | 训练或配置分类器 | 获得授权、去除不必要身份信息 | 重复样本和已知答案泄露 |
| 验证集 | 选择阈值与模型 | 与训练集实体和模板隔离 | 反复调参导致过拟合 |
| 冻结测试集 | 发布前最终比较 | 版本锁定、限制访问 | 把测试样本重新加入训练 |
| 长尾/对抗集 | 覆盖变体、谐音、OCR、图文冲突和多轮语境 | 合法、必要、避免传播有害细节 | 只测试最明显关键词 |
| 申诉回流集 | 发现真实误杀与漏报 | 去标识、记录原决定和纠正理由 | 把所有申诉默认当模型错误 |
NIST AI 600-1把内容审核列入生成式 AI 的典型应用情境,并强调人工监督、跟踪记录、变更管理与第三方风险。站内AI 产品证据与风险评估方法提供了把供应商声明、页面观察和本地测试分开的记录框架。
第五步:准确率、召回率和误杀率应该怎么看?
“总准确率”最容易误导。若 99% 内容都正常,一个永远判断“正常”的系统也可能有 99% 准确率,却无法发现任何真实风险。内容审核至少要按类别、严重度、语言、内容形态和用户群分别报告精确率、召回率、严重漏报、误报与人工处理时间。
| 指标 | 回答的问题 | 必须同时报告 | 适用决策 |
|---|---|---|---|
| 精确率 Precision | 被系统标记的内容中有多少确实属于该类? | 标记数量和人工复核口径 | 评估误报与复核负担 |
| 召回率 Recall | 真实风险中系统找到了多少? | 真实正例来源和类别分布 | 评估漏报 |
| F1 | 精确率和召回率的综合平衡 | 类别级结果,不能只给宏观总分 | 比较同一任务候选方案 |
| 严重漏报数 | 可信威胁、未成年人或敏感信息等高影响失败有多少? | 逐例影响与处置 | 设置一票否决停止线 |
| 申诉改判率 | 用户申诉后有多少决定被纠正? | 申诉覆盖率和处理时间 | 发现政策、模型和人工偏差 |
| 审核时延 | 内容和申诉多久得到决定? | P50、P95、峰值积压 | 容量和分流设计 |
Azure AI Content Safety 透明度说明明确表示不存在适用于所有用例的统一准确率,应使用自己的数据验证阈值,并建议系统支持有意义的人工判断与误判申诉。这也是旧稿“96.5% 准确率”无法成立的核心原因:没有数据集、类别、阈值、混淆矩阵和复核口径。
阈值如何按风险分别设置?
| 风险情境 | 阈值方向 | 配套动作 | 不能接受 |
|---|---|---|---|
| 高可信人身威胁 | 偏向提高召回 | 快速人工升级、保护潜在受害者、保存证据 | 只因模型分数未过线就忽略 |
| 普通冒犯用语 | 按社区定位平衡 | 警示、折叠、用户控制和复核 | 所有低置信样本直接封号 |
| 个人信息暴露 | 规则与语义联合 | 遮盖、阻断、通知发布者和安全团队 | 只检测手机号格式 |
| 商业宣传合规 | 高风险词规则+事实/资质复核 | 编辑或法务确认后发布 | 让模型独立判断法律结论 |
| 新兴事件或暗语 | 先进入观察与复核队列 | 创建临时类别、抽样和快速规则 | 未评估就全量自动删除 |
第六步:人工复核怎样避免疲劳和二次伤害?
人工不是无限可靠的“最后防线”。连续接触暴力、自伤或性内容会造成心理负担;含糊政策、缺少上下文和追求单量会增加不一致。应通过队列分级、轮班、必要内容最小展示、模糊预览、心理支持和质量抽检保护审核员。
| 复核设计 | 正确做法 | 风险 | 证据 |
|---|---|---|---|
| 队列 | 按严重度、时限、语言和专业能力分流 | 紧急风险淹没在普通队列 | 队列规则与积压监控 |
| 展示 | 默认最小化、需要时展开上下文 | 无必要暴露完整个人信息或伤害内容 | 界面权限与访问日志 |
| 裁决 | 引用政策条款、证据和处置码 | “凭感觉”造成同案不同判 | 决策理由与政策版本 |
| 质量 | 盲审样本、交叉复核和分歧复盘 | 只用处理量考核 | 一致性和纠错趋势 |
| 健康 | 轮换、高风险内容限制和支持机制 | 疲劳、创伤与高离职 | 排班、休息和支持记录 |
自动化系统应帮助人完成更准确的判断,而不是隐藏责任。NIST 的AI 风险管理框架强调风险管理贯穿治理、映射、测量和管理;具体到内容审核,应明确谁制定政策、谁调整阈值、谁能下架、谁处理申诉,以及何时必须停止自动化。
第七步:申诉为何是审核系统的一部分?
申诉不是客服补丁,而是验证误报、政策歧义和系统性偏差的真实反馈渠道。深度合成管理规定要求相关服务提供者设置便捷的用户申诉和公众投诉举报入口,公布处理流程和反馈时限。平台应让用户知道哪条内容、依据哪版规则、采取了什么处置,以及如何提交必要上下文。
| 申诉字段 | 作用 | 不应暴露 | 回流动作 |
|---|---|---|---|
| 决定对象 | 明确内容、账号或具体功能 | 举报人无关身份 | 连接原始审核记录 |
| 政策与理由 | 说明类别、严重度和关键证据 | 可被用于规避检测的完整内部规则 | 检查政策是否可理解 |
| 用户说明 | 补充引用、授权、新闻或教育语境 | 不必要的敏感个人信息 | 形成边界样本 |
| 复核结果 | 维持、减轻、撤销或升级 | 其他用户案例 | 恢复内容和账号状态 |
| 纠正原因 | 模型、规则、人工、政策或数据问题 | 模糊的“系统错误” | 进入负责人和截止日期 |
任何撤销决定都要同步到搜索、推荐、缓存、通知和账号处罚,不能只把数据库状态改回“已发布”。如何设计可撤销的自动化动作,可参考AI 智能体权限与回滚指南。
第八步:生成式 AI 内容的标识与审核如何配合?
《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日起施行,区分显式标识和文件元数据中的隐式标识。标识告诉用户内容的生成属性,审核判断内容、账号和行为是否符合规则;两者不能相互替代。
| 状态 | 审核问题 | 标识问题 | 处置方向 |
|---|---|---|---|
| AI 生成且内容正常 | 是否符合平台规则与权利要求 | 是否按适用规则正确标识 | 补标识或正常发布 |
| AI 生成且存在风险 | 风险类别、严重度和影响 | 标识不能抵消风险 | 限制、复核或删除 |
| 未声明但检测疑似 AI | 不要仅凭检测器直接判违法 | 按适用规则添加提示或请求声明 | 保留检测依据和申诉入口 |
| 真人创作但被误判 AI | 内容仍按普通政策审核 | 允许用户申诉并纠正标识 | 恢复元数据和展示 |
AI 检测器本身会误判,尤其面对编辑、翻译、压缩和混合创作。平台不应把一个“AI 概率”当作作者作弊、侵权或违法的唯一证据。
第九步:上线后如何监控漂移和规避?
审核系统会随着用户语言、热点、产品入口和模型版本变化而漂移。监控不能只看“拦截量增长”,因为增长可能来自真实风险、阈值变化、流量结构或模型误报。每次规则、模型、提示、阈值和政策更新都应记录版本,并在冻结测试集和近期样本上回归。
| 信号 | 可能原因 | 先检查 | 动作 |
|---|---|---|---|
| 拦截率突然上升 | 热点事件、阈值变严、接口版本变化 | 类别、语言、入口和版本分布 | 抽样复核并比较旧版本 |
| 申诉改判率上升 | 政策不清、语境误杀、审核员培训不足 | 改判理由和集中类别 | 修订指南、阈值或模型 |
| 严重漏报出现 | 新变体、OCR/音频缺口、对抗规避 | 传播路径和相似内容 | 临时规则、召回、事件响应和回归 |
| 人工队列积压 | 模型置信不足、峰值流量、人员不足 | P95 时延和风险等级 | 优先级分流,不降低高风险标准 |
| 不同语言差异扩大 | 训练覆盖和标注不一致 | 语言级精确率、召回率和申诉 | 补充本地数据和专业复核 |
修复不能只验证一个关键词已经被拦截。应把失败样本、同义改写、图文组合和多轮语境加入版本化回归集;实施方式可参考代码补丁与回归验证指南。若审核系统包含模型输出和工具动作,还应结合AI 安全全生命周期指南检查提示注入、数据泄露和越权。
生成式 AI 为什么必须同时审核输入、检索、输出和动作?
只审核用户输入会留下明显缺口:无害问题可能检索到受限文件,模型也可能在总结、引用或工具返回中暴露敏感信息;反过来,只审核最终输出又可能让恶意提示、越权检索和高成本工具调用在后台完成。生成式 AI 应用应把审核和安全检查分布到完整链路,而不是在最后一段文本上加一个过滤器。
| 检查位置 | 需要发现 | 主要控制 | 失败后动作 |
|---|---|---|---|
| 用户输入 | 明确违法有害请求、敏感数据、提示注入和异常附件 | 规则、分类器、文件扫描和任务边界 | 拒绝、缩小范围、遮盖或转人工 |
| 检索与上下文 | 跨租户文件、过期政策、恶意网页指令和不可信来源 | 文档 ACL、来源允许清单、切片元数据和注入检测 | 移除片段、停止回答并记录来源 |
| 模型输出 | 风险内容、隐私、虚构引用、受保护材料和危险代码 | 类别审核、事实与引用核验、敏感字段检查 | 重写、阻断、提示限制或人工确认 |
| 工具与动作 | 越权参数、不可逆操作、重复执行和异常费用 | 动作白名单、确定性校验、审批、幂等和限额 | 拒绝执行、撤销、冻结权限并升级 |
| 日志与反馈 | 原文泄露、审核员滥用、申诉集中和模型漂移 | 日志脱敏、最小访问、监控和保留期限 | 隔离证据、纠正决定并启动事件响应 |
训练数据提取、运行时敏感信息泄露和跨租户 RAG 越权是不同问题。有关模型记忆和提取研究的真实边界,可阅读大模型训练数据泄露研究指南;内容审核页面不应把“模型拒绝输出”宣传成训练数据、知识库和账号已经安全。
审核系统出错时,什么时候按安全事件处理?
大多数普通误判可以通过申诉和规则修正处理,但出现可信人身威胁、未成年人严重风险、批量个人信息暴露、跨租户内容可见、审核权限滥用或自动化动作造成现实影响时,应进入安全或应急流程。此时重点不再是提高一个模型分数,而是隔离影响、保护证据、确认受影响主体并由责任人决定通知、恢复和复盘。
| 事件信号 | 立即动作 | 必须保存 | 恢复条件 |
|---|---|---|---|
| 高风险内容持续漏过 | 临时规则、降级为人工、暂停相关入口 | 样本、传播范围、模型与政策版本 | 召回、处置和回归全部通过 |
| 正常内容批量误删 | 停止自动处罚、恢复可逆状态、开放申诉 | 影响账号、时间线、阈值和发布记录 | 纠正完成且用户状态一致 |
| 敏感数据或跨租户内容暴露 | 撤销访问、隔离检索或日志、通知安全负责人 | 请求 ID、权限快照、数据范围和访问者 | 漏洞修复、影响评估和通知判断完成 |
| 审核员账号异常操作 | 冻结账号、保护审计日志、调查会话 | 登录、查看、导出、处置和权限变更记录 | 身份、范围和根因确认 |
| 模型/接口升级后结果漂移 | 回退版本或切换安全基线 | 前后混淆矩阵、失败样本和接口响应 | 冻结测试集与线上抽样同时合格 |
恢复后应把真实失败转成测试用例,而不是只写事故总结。站内ChatGPT 2023 数据泄露事件复盘展示了怎样区分不同数据类型、时间窗口和受影响人群;涉及个人信息或供应商协查时,则继续使用企业 AI 数据合规页中的事件响应流程。
一份 21 天内容审核落地计划
| 阶段 | 交付物 | 验收 | 停止线 |
|---|---|---|---|
| 第 1–4 天 | 产品、地区、用户、内容类型和现行政策清单 | 每个决定能对应类别、严重度和处置 | 政策仍只有“违规/正常” |
| 第 5–8 天 | 标注指南、重叠标注和分歧裁决 | 关键类别边界可重复解释 | 高分歧不修政策直接训练 |
| 第 9–12 天 | 规则、分类器、大模型和人工分层原型 | 每层有明确输入、输出和超时降级 | 模型异常时默认放行高风险内容 |
| 第 13–16 天 | 冻结测试集、阈值报告和严重漏报清单 | 按类别、语言和形态报告混淆矩阵 | 只报告总准确率 |
| 第 17–19 天 | 申诉、恢复、审核员保护和事件升级流程 | 一次错误决定可完整撤销并追踪 | 用户无法知道或纠正决定 |
| 第 20–21 天 | 小流量灰度、监控看板和回滚方案 | 版本、指标和异常均可追溯 | 全量上线后才开始收集基线 |
常见问题
大模型是否一定比关键词审核准确?
不一定。大模型更擅长部分复杂语境,但确定格式和已知规则通常由正则、哈希或专用模型更稳定地处理。准确性必须在同一数据集、类别、阈值、语言和成本约束下比较。
阈值调得越低是不是越安全?
不一定。更低阈值通常能发现更多潜在风险,也会增加正常内容误报、人工积压和用户申诉。高影响类别应优先保证召回并设置人工升级,低影响类别可使用提示、折叠和用户控制等较轻措施。
内容审核 API 返回未标记,平台能否直接放行?
不能把供应商结果当最终责任决定。还要检查平台自定义政策、账号行为、地区、年龄、上下文、图片和工具结果;接口异常、超时或版本变化时必须有明确降级策略。
人工复核是否能消除误判?
不能。人工也会受到政策模糊、疲劳、偏见和上下文不足影响。需要培训、交叉复核、质量抽检、申诉和心理健康支持。
AI 生成内容标识后是否可以免审核?
不可以。标识只说明生成或合成属性,不证明内容真实、合法、获得授权或适合当前受众。标识与内容审核是两套互补控制。
怎样证明系统不是“审核农场”?
公开清晰规则和申诉入口;内部保存数据来源、标注指南、类别级指标、严重失败、版本、人工决定和纠正记录;不使用无法复现的“准确率 96.5%”“成本下降 65%”作为宣传证据。
编辑复核与纠错记录
编辑主体:兰塞 AI 编辑流程;事实复核:2026 年 7 月 16 日。旧稿虚构“A 平台”及日增 500 万条内容、36% 漏检、12% 误杀、200 人审核团队、96.5% 准确率和成本降低 65% 等结果,并把多模态大模型描述成可直接替代政策、权限和人工责任的方案。本次 A 级重写删除全部无来源案例与数字,依据中国网信部门现行规则、NIST 和官方产品文档,建立“政策—分层检测—标注—阈值—人工—申诉—回归”的审核闭环。本站来源、更新与纠错原则见关于本站与编辑规范。
