直接答案:检测和减少 AI 偏差,不能只看模型总准确率,也不能在上线前跑一次“公平性分数”就结束。可靠做法是先定义系统会影响谁、什么结果算伤害,再按群体和交叉群体拆分数据质量、选择率、误报、漏报、校准和生成内容表现;针对根因选择数据、训练、阈值、流程或人工复核措施,最后持续监控漂移、反馈、申诉和停用条件。
公平不是一个固定公式。招聘、信贷、医疗分诊、内容推荐和生成式 AI 的任务、标签、损害与责任不同,适用的指标也不同。某项群体差异变小,可能同时降低另一项指标或整体效用;所以每个指标都必须和使用情境、基准组、样本量、置信区间、决策阈值及人工流程一起解释,并记录选择理由与未解决风险。

AI 偏差是什么,不是什么
这里的 AI 偏差指会让某些个人或群体持续承受不利结果的系统性模式。它可能来自社会与制度背景、任务定义、样本覆盖、标签和测量、特征代理、优化目标、部署流程、用户行为或反馈循环。它不等同于神经网络公式中的 bias 参数,也不等同于“预测均值与标签均值之差”的 prediction bias。
NIST 的有害偏差研究说明强调,偏差并非 AI 独有,也不总是负面现象;真正需要管理的是会被自动化系统扩大、加速或固化的有害偏差。NIST SP 1270进一步把系统性、统计/计算和人类认知等来源放进社会技术系统中理解,而不是把责任全部推给训练集。
| 来源 | 典型表现 | 只改模型为什么不够 | 主要证据 |
|---|---|---|---|
| 情境与制度 | 错误问题被自动化;弱势群体原本就更难获得机会 | 模型可能准确复制不公平的历史流程 | 业务规则、政策、利益相关方访谈 |
| 数据与覆盖 | 少数群体样本过少、缺失率高、采样时间不一致 | 重训仍会学习相同覆盖缺口 | 群体分布、缺失、来源和时间窗 |
| 标签与测量 | “优秀员工”“风险客户”等标签受旧决策影响 | 标签并不等于真实能力或未来结果 | 标签定义、标注一致性、代理变量审查 |
| 模型与阈值 | 总体准确率高,但特定群体漏报或误报更高 | 单一总指标会掩盖切片差异 | 分组混淆矩阵、阈值曲线、置信区间 |
| 部署与交互 | 人工过度相信模型;用户以不同方式使用系统 | 离线公平不代表真实流程公平 | 人工覆核、申诉、使用日志、现场观察 |
| 反馈循环 | 推荐越多获得的数据越多,未曝光对象越来越不可见 | 系统会改变下一轮训练数据 | 曝光、点击、拒绝、退出和长期结果 |
第一步:先定义决策、受影响人群和不可接受伤害
不要从“该用哪个公平性库”开始。先写一张情境卡:系统提供建议还是直接决定;正类和负类分别意味着什么;谁获得机会、资源或审查;谁可能被误报、漏报或刻板描绘;错误能否撤回;是否涉及就业、教育、金融、医疗、公共服务或其他高影响用途;谁有权暂停系统。
| 必须写清的问题 | 招聘筛选示例 | 生成式客服示例 |
|---|---|---|
| 模型输出 | 进入人工面试的优先级,不是录用决定 | 生成建议答复,不直接执行退款或拒赔 |
| 主要伤害 | 合格候选人被系统性漏掉 | 对特定语言、地区或身份产生差别质量 |
| 关键群体 | 按适用规则与业务风险确定,关注交叉群体 | 语言、设备、地区、无障碍需求和问题类型 |
| 可接受边界 | 先设最低召回与人工复核要求,再比较群体差异 | 高风险意图必须转人工,拒答和错误率需分组监控 |
| 救济路径 | 允许候选人补充材料和人工复核 | 提供明确纠错、升级和投诉入口 |
中国科技部发布的《新一代人工智能伦理规范》要求把公平、公正、安全、隐私和避免偏见歧视融入人工智能全生命周期。它是伦理规范,不替代具体行业法律判断;涉及个人信息、自动化决策或高影响场景时,应由法务、隐私、业务和受影响群体共同确认边界。
第二步:审计数据、标签和代理变量
数据审计至少覆盖来源、采集目的、时间范围、群体代表性、缺失、重复、异常、标签生成方式和使用权利。Google 的偏差识别课程提示,缺失值、意外特征值、覆盖不均和数据偏斜都可能是风险信号。数据量大并不能自动补足被遗漏群体。
| 检查项 | 最低记录 | 危险信号 | 可能动作 |
|---|---|---|---|
| 样本覆盖 | 每个群体和交叉群体的样本数、时间和来源 | 关键群体几乎没有样本 | 补采、扩大时间窗或限制适用范围 |
| 缺失模式 | 总体与分组缺失率 | 某群体关键字段长期缺失 | 修复采集流程,避免简单均值填充掩盖问题 |
| 标签质量 | 标签定义、生成者、争议和一致性 | 标签直接复用历史审批或惩罚结果 | 重定义目标、双人复核或引入更接近真实结果的标签 |
| 代理变量 | 地理、学校、设备、消费等与敏感属性的关系 | 删除敏感字段后差异仍存在 | 因果与业务审查,不把“删列”当公平证明 |
| 数据权利 | 目的、授权、保留期、访问者和删除机制 | 为了测公平而无限收集敏感数据 | 先做合法性、必要性和安全控制评估 |
敏感属性在公平性评估中可能有测量价值,但收集、推断、存储和使用本身也可能制造风险。工程团队不能因为“要做公平”就默认有权处理这些数据;也不能因为不保存敏感属性就宣称系统公平。需要明确权限、最小化、隔离、保留期和删除机制,并记录无法测量的盲区。
第三步:建立总体基线,再做分组和交叉群体测量
先固定测试集、时间窗、模型版本和决策阈值,计算总体任务指标;然后用相同口径按群体拆分。分类系统通常从每组的样本数、选择率、准确率、精确率、召回率/真阳性率、假阳性率和校准开始。生成式系统则需要按语言、任务、身份提示、主题和风险等级建立成对或模板化测试集,记录事实错误、拒答、毒性、刻板印象、帮助程度与人工升级。
Google 的公平性评估说明明确指出,聚合的 accuracy、precision 和 recall 可能掩盖少数群体表现;Fairlearn Assessment提供按敏感特征分解指标的 MetricFrame。两者都不能替团队决定“哪个差异在当前场景最重要”。
| 指标 | 回答的问题 | 适合关注 | 不能单独证明 |
|---|---|---|---|
| 选择率 | 各组获得正向结果的比例是否不同 | 机会或资源分配的第一层扫描 | 获得结果的人是否真的合格 |
| 真阳性率/召回率 | 真实正类中,各组被识别出的比例 | 漏掉合格者或漏诊的伤害 | 误报是否相同 |
| 假阳性率 | 真实负类中,各组被错误判正的比例 | 错误审查、警报或惩罚风险 | 漏报是否相同 |
| 精确率 | 被判正的对象中,各组有多少确实为正 | 后续资源浪费或误指控 | 所有合格对象能否获得机会 |
| 校准 | 同一分数在各组是否对应相近真实概率 | 风险分数和分层干预 | 阈值决策是否公平 |
| 反事实测试 | 只改变相关属性或表述,结果是否不合理变化 | 个体级与生成内容探查 | 社会结构和群体分布问题已解决 |
Google 指标词汇表提醒,多种公平定义可能互不兼容;不能把 demographic parity、equalized odds、equality of opportunity 和 predictive parity 同时当作必然可满足的目标。应根据伤害模型选主指标,同时报告任务质量和其他受影响指标。
第四步:不要忽略样本量、交叉群体和不确定性
“A 组 82%,B 组 76%”并不能直接说明存在稳定差异。必须同时记录每组样本数、事件数、时间窗、置信区间和重复评估结果。样本太小时,不应把随机波动包装成精确结论,也不应为了让表格好看而合并掉高风险群体。
| 常见错误 | 为什么误导 | 改进方式 |
|---|---|---|
| 只按单一属性分组 | 性别总体看似正常,特定年龄×地区群体仍可能异常 | 预先定义有业务意义的交叉切片并控制多重比较 |
| 只报告比率 | 极小样本可能产生巨大波动 | 报告分子、分母、区间和最小样本规则 |
| 在训练集上测 | 不能证明新用户或未来时期表现 | 使用独立验证集、时间外测试和上线监控 |
| 不断换阈值直到“公平” | 可能过拟合公平性评估集 | 保留独立验收集并记录所有试验 |
| 只测平均用户 | 辅助设备、低带宽或小语种用户被隐藏 | 把可访问性、设备和语言纳入真实任务切片 |
如果某群体样本不足,正确结论通常是“当前证据不足以验证”,而不是“没有发现偏差”。这类未知项应进入风险登记,并通过限制用途、增加人工复核、补充数据或暂停部署处理。
第五步:根据根因选择缓解措施
缓解措施可以发生在模型前、训练中、模型后和业务流程中。Fairlearn Mitigations包含重加权/约束、阈值优化和相关性移除等算法,但文档明确提醒:算法可以把某个数学差异压近零,并不意味着结果在现实中就是公平的。
| 层级 | 措施 | 适用前提 | 主要副作用 |
|---|---|---|---|
| 任务与流程 | 取消不必要的自动决策、缩小用途、增加申诉和人工复核 | 伤害来自错误自动化或不可逆流程 | 成本和响应时间增加 |
| 数据前处理 | 补充覆盖、纠正标签、重采样、重加权 | 根因可追溯到代表性或标签质量 | 可能放大噪声或改变目标分布 |
| 训练中 | 公平约束、损失权重、对抗式方法 | 指标定义清楚且训练过程可控 | 任务性能与公平指标发生权衡 |
| 模型后处理 | 调整阈值、校准、转人工规则 | 已有模型难以重训,且操作合法可解释 | 不同阈值可能带来治理和沟通问题 |
| 生成式系统 | 改进检索与提示、增加约束、分类器、红队和人工升级 | 偏差出现在开放式输出或安全策略 | 过度过滤、拒答增加或语言质量下降 |
缓解后必须回到同一冻结验收集,重新测任务质量、主公平指标、次级指标、可靠性、安全与成本。不要只展示改善的那一列。需要微调模型时,可结合本站的大模型微调与上线验收指南;如果问题本质是事实证据不足,应先使用AI 幻觉核验框架,而不是把事实错误误称为“偏见”。
用 Fairlearn 做一个最小分组评估
下面示例只演示分组测量结构,不代表适用于任何真实决策。sensitive_features 的处理必须经过适用规则和隐私评估;正式报告还应增加样本数、置信区间、交叉群体、数据版本和阈值记录。
from fairlearn.metrics import MetricFrame, selection_rate
from sklearn.metrics import accuracy_score, precision_score, recall_score
metrics = {
"accuracy": accuracy_score,
"precision": precision_score,
"recall_tpr": recall_score,
"selection_rate": selection_rate,
}
report = MetricFrame(
metrics=metrics,
y_true=y_test,
y_pred=y_pred,
sensitive_features=group_test,
)
print(report.overall)
print(report.by_group)
print("difference:", report.difference())
print("ratio:", report.ratio())
代码输出后至少问五个问题:每组分母是多少;差异是否稳定;标签是否可信;该指标是否对应真实伤害;改变阈值后谁受益、谁承担代价。需要置信区间和交叉群体时,应按Fairlearn 用户指南当前版本实现并锁定依赖,不能从一次 notebook 输出直接宣布系统“通过公平审计”。
生成式 AI、推荐系统与分类模型要怎么分别测
| 系统类型 | 测试单位 | 建议切片 | 主要风险 |
|---|---|---|---|
| 二分类/评分 | 带真实结果的样本和固定阈值 | 群体、交叉群体、时间、渠道 | 误报、漏报、机会差异、校准失真 |
| 推荐/排序 | 曝光、位置、点击、满意度和长期结果 | 用户群体、供给方、内容类型、冷启动 | 曝光集中、反馈循环、弱势内容不可见 |
| 文本生成 | 成对提示、真实任务、拒答和人工评分 | 语言、方言、身份表述、主题、风险等级 | 刻板印象、差别帮助度、毒性、过度拒答 |
| 图像/视频生成 | 固定提示模板与多次采样 | 职业、角色、地区、肤色、年龄、残障 | 代表性失衡、身份刻板化、错误关联 |
| Agent/自动化 | 整条任务轨迹、工具调用和最终影响 | 用户权限、数据源、任务类型、失败分支 | 差别权限、错误执行、无法追责和回滚 |
推荐系统不能只比较点击率;排名本身会改变曝光和后续数据。生成式模型不能只问一次“医生是什么样的人”,应使用预先注册的提示集合、多个随机种子或采样、盲评规则和版本记录。Agent 还要审计工具权限和动作边界,可参考本站的AI Agent 部署、权限与治理指南。图像任务可结合AI 绘画工具选择与商用边界设计代表性测试。
第六步:上线后持续监控、申诉和停用
离线测试只覆盖已知数据。上线后,用户、业务规则、输入分布、阈值、上游数据和模型版本都会变化。NIST AI RMF Playbook 把治理拆为 Govern、Map、Measure、Manage;其中Measure建议识别可能成为群体代理的特征,结合领域专家调查差异根因,并持续衡量公平与偏差。Playbook 总页也说明它是自愿参考,不是一张可以机械勾完的通用清单。
| 运行证据 | 频率 | 触发动作 |
|---|---|---|
| 输入与群体分布漂移 | 按风险实时、每日或每周 | 复核数据源、限制新分布或启动再验收 |
| 分组任务与公平指标 | 固定窗口并保留历史 | 超阈值后转人工、降级或暂停 |
| 人工覆核和推翻率 | 持续记录 | 分析人机分歧及人工自身偏差 |
| 投诉、申诉和撤销 | 实时受理、周期复盘 | 纠正个案,查找系统性根因并通知受影响者 |
| 版本与配置变更 | 每次发布 | 重跑受影响测试集,保留回滚版本 |
| 第三方模型更新 | 供应商变更时 | 重新验证,不沿用旧版结论 |
2026 年 NIST 发布的部署后 AI 监控挑战报告再次强调现实运行监控存在数据、反馈、责任和测量障碍。无法获得真实结果或申诉数据时,应把它记录为关键盲区,而不是用模型置信度替代。
上线前的偏差治理验收清单
| 闸门 | 通过证据 | 阻断条件 |
|---|---|---|
| 情境 | 用途、受影响人群、伤害、责任与退出机制已签字 | “先上线再看”或自动化了不应自动化的决定 |
| 数据 | 来源、权利、覆盖、缺失、标签、代理与时间窗可追溯 | 关键群体不可测且没有限制用途 |
| 指标 | 主指标与伤害对应,报告分组值、样本数和区间 | 只给总体准确率或单个公平分数 |
| 缓解 | 根因、措施、权衡和复测结果完整 | 只调到好看的阈值,任务质量或另一群体明显恶化 |
| 人工 | 复核者能理解限制、推翻建议并记录理由 | 人工只是橡皮图章或没有处理时限 |
| 运行 | 监控、报警、申诉、停用、版本和回滚机制已演练 | 上线后无法发现或撤回伤害 |
高影响的人力分析场景可进一步参考AI 离职风险分析与公平性清单;模型比较不能只看排行榜,可结合Arena 排名偏差与模型选型指南。更广泛的责任、透明和问责问题见AI 道德准则指南。
常见问题
删除性别、年龄等字段,就能消除 AI 偏差吗?
不能。地理位置、学校、设备、消费和行为特征可能成为代理变量;历史标签和流程也可能继续编码差异。是否保留敏感属性用于审计,要同时评估必要性、合法性、权限和安全,而不是简单“删列”。
不同群体选择率相同,就代表公平吗?
不一定。选择率相同可能掩盖资格、标签或错误率差异;在某些情境中,漏报或误报差异比选择率更接近真实伤害。指标要由决策目的和受影响者共同确定。
可以给 AI 系统一个统一的公平分数吗?
可以做内部汇总看板,但不能用一个分数替代原始分组指标、样本量、区间和情境说明。不同指标可能冲突,汇总权重本身也是价值判断。
开源公平性工具能证明系统合规吗?
不能。Fairlearn 等工具能帮助计算、比较或缓解特定数学指标,但不替你判断适用法律、数据权利、社会伤害、流程公平和申诉责任。工具输出是证据的一部分,不是合规结论。
生成式 AI 没有固定标签,怎么测偏差?
建立覆盖身份、语言、任务和风险等级的提示套件,固定版本与采样设置,多次生成并按预先定义的刻板印象、帮助程度、事实性、毒性和拒答规则盲评;同时监控真实用户反馈和人工升级。不要用几个演示提示替代系统评估。
结论:把公平从口号变成可审计决策
AI 偏差治理的核心不是追求一张“零偏差”证书,而是能回答:系统影响谁、什么伤害最重要、证据是否足够、为何选择这些指标、采取了什么措施、牺牲了什么、上线后如何发现问题,以及受影响者如何获得解释、纠正和退出。做到这些,模型才从一次性实验进入可问责的运行系统。
资料复核日期:2026 年 7 月 23 日。公平性工具、标准、监管要求和第三方模型会变化;部署前应重新核对官方文档和适用法域。
