直接答案:医院落地 AI,第一步不是采购“全院大模型”,而是选择一个边界清楚、失败后果可控、能人工复核、已有流程基线的任务。项目应依次完成预期用途、风险分级、数据与接口准备、回顾性验证、静默运行、有限真实试点、分阶段扩围和持续监测;任何影响诊断、用药、治疗或转诊的输出,都必须保留专业人员批准、审计、降级和停用路径。

医疗提示:本文面向医院管理、医务、临床、信息、安全、数据和采购团队,解释项目实施与治理,不提供个人诊断、处方或治疗建议。资料复核日期为 2026 年 7 月 19 日。政策、产品注册或备案状态、模型版本、指南知识库和数据处理规则可能变化,采购与临床使用前应以现行法规、监管数据库、产品说明书和本机构制度为准。
先撤回旧稿:没有证据支持“诊断效率提升 30%”
本页旧版本把“诊断效率提升 30%”写进标题,并声称调研了多家医院、在某省会三甲医院完成项目,随后给出病历耗时、漏诊率、候诊时间、营收、成本、投资回收期和患者满意度的精确变化。旧稿没有公开医院名称、研究方案、样本、对照、统计方法、合同、评估报告或可核验来源,也无法证明文中的医生与患者引语真实存在,因此这些叙述全部撤回。
| 旧稿说法 | 阻断问题 | 本次处理 |
|---|---|---|
| 诊断效率提升 30% | 没有定义诊断任务、分母、时间范围和比较方法 | 删除通用百分比,改为任务级基线与指标 |
| 某三甲医院 4.5 个月回本 | 医院、投入、收入和成本均不可核验 | 删除案例与 ROI,只给出经济评价所需数据 |
| 张医师、李医师、王先生反馈 | 匿名引语没有采访记录或授权 | 全部删除,不制造亲历感 |
| 模型越用越聪明 | 忽略版本冻结、漂移、错误放大和变更复验 | 改为受控变更、回归验证和回滚 |
| 把 AI 采纳率纳入绩效 | 可能诱发机械接受和自动化偏误 | 记录接受与拒绝理由,不奖励盲目采纳 |
如果你需要判断某个诊断产品的敏感度、特异度、外部验证和适用人群,请阅读AI 医疗诊断的临床验证清单;基层机构与县域医共体的协同方式见基层医疗 AI 落地指南;放疗等高风险治疗规划见AI 放疗计划上线与监测清单。本页只解决医院级项目从立项到退出的治理问题。
政策列出了场景,但没有替医院完成风险判断
国家卫生健康委等部门发布的“人工智能+医疗卫生”实施意见覆盖基层、临床诊疗、患者服务、科研教学和行业治理,并提出医学影像、临床专病辅助、智慧药房、预问诊、随访、医院管理等方向。此前发布的卫生健康行业人工智能应用场景参考指引进一步列出医疗文书质控、医疗质量、排班、手术室、药房、耗材和设备管理等场景。
这些文件说明“哪些方向可以探索”,不等于任意产品已经证明安全有效,也不意味着医院可以把所有场景接进一个模型。相同技术用于会议纪要和治疗建议,错误后果完全不同;同一个影像模型在不同设备、协议、患者人群和工作流中也可能表现不同。医院仍要核对产品预期用途、监管状态、证据、本地适用性和责任边界。
| 场景组 | 任务示例 | 通常优先检查 | 不能直接推出 |
|---|---|---|---|
| 行政与知识 | 制度检索、会议摘要、工单分类 | 来源、权限、事实错误、泄露 | 通用模型可读取全部院内数据 |
| 文书与质控 | 缺项提示、病历草案、编码辅助 | 事实忠实、错写入、医生复核负担 | 自动生成即可自动签署 |
| 患者服务 | 预约、导诊、预问诊、随访 | 急症升级、身份、无障碍和人工渠道 | 聊天机器人可做最终分诊 |
| 临床支持 | 影像、处方、诊断候选、风险预警 | 漏报、亚组、临床影响、监管状态 | 论文准确率等于本院可上线 |
| 治疗与自动执行 | 治疗计划、剂量、设备控制 | 患者伤害、独立复核、故障安全 | 高效率允许弱化人工门禁 |
| 运营管理 | 床位、排班、手术室、库存预测 | 数据偏差、资源公平、人工override | 预测结果可自动拒绝服务 |
第一步:用四维评分卡选第一个项目
首个项目的目标不是展示技术覆盖面,而是建立一条能被医院重复使用的验证和治理路径。建议把候选功能拆到单一动作,例如“发现出院记录缺少随访计划”,而不是“建设智能病案平台”;再分别评估患者风险、人工复核、数据准备和可测量价值。
| 维度 | 关键问题 | 适合先做 | 应暂缓 |
|---|---|---|---|
| 错误后果 | 错误会延误诊疗、用药或治疗吗? | 错误可在写入前发现 | 错误可直接改变患者处置 |
| 人工复核 | 正确角色能在合理时间内检查吗? | 有明确队列、依据和拒绝按钮 | 复核只是形式或根本来不及 |
| 数据准备 | 字段、单位、身份、时间和版本可靠吗? | 已有结构化数据和稳定接口 | 主要依赖缺失、错配或扫描文本 |
| 价值可测 | 不用 AI 时的质量、时间和成本基线是什么? | 有可比较流程指标与患者路径 | 只能用登录量、生成量证明价值 |
四项中任何一项是红色,都不应靠“模型更强”强行上线。低风险文书质控也可能因为自动写入错误患者病历而变成高风险;看似高价值的急症预测,如果没有及时响应队列,也只会增加无人处理的告警。
第二步:写一张“预期用途卡”,防止项目边界不断膨胀
预期用途不是一句“赋能诊疗”,而是明确谁在什么场景、使用什么输入、获得什么输出、做什么决定。WHO 的医疗 AI 伦理与治理指南要求把伦理、人权、责任与公共利益纳入设计和使用;WHO 的医疗 AI 监管考虑强调预期用途、外部验证、数据质量、人类干预、生命周期文档和网络安全。
| 字段 | 必须写清 | 不合格示例 |
|---|---|---|
| 用户 | 具体科室、岗位、资质和培训 | “全院医护人员” |
| 患者/对象 | 年龄、人群、病种、机构和排除条件 | “所有患者” |
| 输入 | 字段、设备、格式、时间窗口、缺失处理 | “全量医疗数据” |
| 输出 | 草案、提醒、候选、排序或控制动作 | “智能决策” |
| 人类动作 | 谁查看、批准、拒绝、升级和记录 | “医生参考” |
| 禁止用途 | 不得使用的人群、输入、科室和自动动作 | 只写“仅供参考” |
| 失败模式 | 超时、缺项、错配、冲突和系统不可用 | 默认永远在线 |
生成式或多模态大模型还应写明知识库来源、检索失败、引用显示、工具权限和拒答规则。WHO 的大模型医疗治理指南特别提醒任务定义、利益相关方参与、发布后审计和影响评估。语言流畅、会解释或会引用,并不能证明它适用于临床决策。
第三步:先完成数据、接口、权限和原流程基线
医院 AI 失败经常不是模型不会算,而是数据指向了错误患者、单位不一致、报告尚未审核、接口丢字段、知识库过期,或输出没有送到能处理的人。立项阶段应同时画出数据流和患者流程:数据从哪里来、何时算“最终”、谁能查看、谁能修改、输出写到哪里、故障后回到哪个原流程。

| 对象 | 上线前证据 | 运行时控制 | 阻断条件 |
|---|---|---|---|
| 患者身份 | 主索引、合并/拆分规则、测试样本 | 错配告警与人工核对 | 无法可靠关联患者与就诊 |
| 临床数据 | 字段、单位、时间、状态和来源字典 | 缺失、异常、迟到和冲突监测 | 关键字段由模型猜测 |
| 知识来源 | 指南版本、适用人群、更新责任 | 过期提醒、引用和回滚 | 来源不明或无法复现答案 |
| 接口 | 正常、边界、故障和并发测试 | 延迟、失败、重试与幂等监测 | 失败后重复写入或静默丢失 |
| 权限 | 实名账号、岗位授权、供应商访问清单 | 最小权限、到期回收和异常访问 | 共享账号或长期超级权限 |
| 原流程 | 当前质量、时间、人员和事件基线 | AI 与原流程的可比监测 | 不知道改造前表现 |
医疗健康信息属于敏感个人信息。《个人信息保护法》要求处理具有特定目的、充分必要性并采取严格保护措施,具体条文见法律原文。医疗卫生机构网络安全管理办法要求落实网络和数据安全主体责任、等级保护、全生命周期安全、第三方管理和应急处置;国家卫生健康委的电子病历信息使用管理通知要求专有身份、按岗位授权、外部服务商协议以及操作和数据流向可追溯。
更通用的数据最小化、权限和事件响应方法见企业 AI 数据合规指南;RAG 或知识库的来源、版本与检索验收见AI 知识管理与 RAG 验收指南。医疗机构仍需结合具体产品、处理活动和法律意见执行,本文不构成法律意见。
第四步:从回顾性验证走到静默运行,不能跳级
DECIDE-AI指出,许多 AI 系统在临床前、模拟环境中表现良好,但尚未证明真实患者照护获益;早期真实临床评价还要观察安全、人因和工作流。2026 年发表于 Nature Medicine 的临床 AI 就绪原则也主张从基准成绩转向逐步、以评价为先的真实世界采用。

| 阶段 | 系统是否影响真实决策 | 主要回答 | 通过证据 |
|---|---|---|---|
| 0. 预期用途 | 否 | 谁用、为何用、错了会怎样 | 用途卡、风险登记、责任与基线 |
| 1. 回顾性验证 | 否 | 固定版本在本院历史数据怎样表现 | 预设方案、错误和亚组报告 |
| 2. 静默运行 | 否 | 实时数据、接口和流程是否可靠 | 输出与真实处置逐例比对 |
| 3. 有限试点 | 有限、全部人工批准 | 人机交互、告警和安全是否可接受 | 临床事件、接受/拒绝理由、可用性 |
| 4. 分阶段扩围 | 是,限定人群/科室 | 扩大后是否保持效果和支持能力 | 门禁评审、培训、现场支持与回滚 |
| 5. 持续监测 | 是 | 漂移、变更、故障和不公平是否出现 | 看板、事件复盘、定期再批准 |
“静默运行”是指系统读取真实时间流入的数据并生成结果,但结果不展示给临床人员、不改变患者处置;团队把它与最终诊断、处方、报告、转诊或运营结果比较。这样既能发现接口和人群差异,也避免未经验证的输出影响患者。静默阶段仍涉及真实数据处理,不能绕过授权、安全和伦理/管理要求。
第五步:验收指标必须覆盖性能、工作流和患者结果
FUTURE-AI 国际共识指南把公平、通用性、可用性、稳健性、可解释性和可追溯性作为可信、可部署医疗 AI 的核心原则。只报总体准确率或节省时间,会掩盖关键亚组漏报、告警疲劳、错误自动写入和真实处置未改善等问题。
| 指标层 | 建议测什么 | 需要怎样分层 | 不能替代 |
|---|---|---|---|
| 输入质量 | 缺失、错配、单位异常、报告状态错误 | 科室、设备、接口、时间段 | 模型准确率 |
| 任务性能 | 敏感度、特异度、预测值、校准或事实忠实度 | 关键人群、病种、严重度 | 单一平均分 |
| 临床安全 | 潜在伤害、漏掉红旗、错误处置和延迟 | 错误严重度与可恢复性 | “大多数正确” |
| 人机协作 | 看见、理解、接受、修改、拒绝、绕过原因 | 岗位、经验、班次 | 采纳率越高越好 |
| 工作流 | 总耗时、返工、告警负担、队列积压 | 高峰/非高峰、不同科室 | 模型响应时间 |
| 患者路径 | 正确处置时间、复诊、转诊完成、随访和结局 | 公平与可及性人群 | 生成量和点击量 |
| 运行安全 | 可用性、接口失败、越权、泄露、回滚时间 | 版本与供应链 | 演示环境 SLA |
不同任务需要不同主指标。病历质控可关注真实缺陷检出、误报和医生返工;影像辅助要关注病灶级错误、亚组、设备、读片流程与患者结局;排班预测要关注等待、公平、员工负荷和人工调整。经济评价也应记录真实开发、接口、标注、培训、复核、维护、故障和退出成本,不能只用“节省人时 × 工资”推算 ROI。
第六步:把人工复核做成界面、队列和责任,不是一句免责声明
“AI 建议仅供参考”不能自动降低风险。如果输出被默认写入、拒绝按钮隐藏、依据不可见、告警没有优先级,医务人员仍可能机械接受或完全忽略。人工复核应明确谁在什么时限内处理,展示输入缺口、依据、置信或不确定性,允许修改和拒绝,并记录最终动作。
| 角色 | 上线前 | 运行中 | 不可外包 |
|---|---|---|---|
| 项目治理委员会 | 批准用途、风险、资源和门禁 | 审查事件、变更、扩围与停用 | 机构治理责任 |
| 临床负责人 | 定义任务、禁用场景和安全指标 | 复核错误、患者影响和临床变更 | 专业判断与患者责任 |
| 信息/数据团队 | 接口、身份、字段、版本和灾备 | 数据质量、可用性、回滚和配置 | 院内系统控制 |
| 安全/合规 | 合法性、权限、日志、第三方和事件方案 | 异常访问、泄露、审计和报告 | 主体安全责任 |
| 一线用户 | 可用性测试、培训和演练 | 批准/拒绝、记录理由和报告问题 | 真实工作流反馈 |
| 供应商 | 证据、限制、数据流、版本和退出材料 | 支持、补丁、变更通知和故障复盘 | 医院对患者的责任 |
生成式系统还要防止伪造来源、把检索片段当临床结论、工具越权和状态误报。技术威胁建模可参考AI 安全威胁模型,内容事实核验流程可参考AI 内容人工审核指南;医疗项目必须在此基础上增加患者、临床责任、病历和最终处置闭环。
第七步:采购合同要覆盖版本、事件、迁移与删除
演示通常只展示成功案例,RFP 则应主动测试拒答、错患者、缺字段、接口超时、急症升级、权限撤销、版本切换和数据删除。医院需要的不是一份“准确率很高”的 PPT,而是可验证、可运行、可审计、可退出的产品和服务。
| 采购问题 | 要求提交 | 危险回答 |
|---|---|---|
| 产品做什么 | 预期用途、适用/禁用范围、监管状态 | “覆盖全流程、全病种” |
| 证据是什么 | 研究方案、数据、外部验证、限制与不良结果 | 只给最好的一张图 |
| 如何接入 | 字段、接口、设备、并发、错误和回退方案 | “提供 API 即可” |
| 数据如何处理 | 目的、范围、地点、分包、训练、保留与删除 | “符合行业标准” |
| 模型如何更新 | 版本冻结、通知、变更说明、回归与回滚 | 后台自动升级、客户无感 |
| 发生事件怎么办 | SLA、分级、通知时限、日志、取证与纠正措施 | 只有普通客服工单 |
| 合同结束怎么办 | 标准格式导出、迁移协助、配置与日志交付、删除证明 | 只能导出 PDF 或继续付费查看 |
合同还应写明供应商不得未经授权用业务数据训练通用模型,任何分包商和跨系统流转都要透明;重大模型、知识、接口或安全变更必须提前通知,并由医院决定是否回到静默验证。医院要保留原流程和紧急停用能力,不能让单一供应商成为不可替代的临床基础设施。
第八步:用 90 天建立最小可用治理闭环
下面是兰塞 AI 编辑部的项目规划模板,不是国家统一工期,也不保证收益。高风险临床软件可能需要更长时间、监管审评、伦理审查或正式临床研究。模板的价值是让每一步都有交付物和退出条件。
| 时间 | 工作 | 交付物 | 继续条件 |
|---|---|---|---|
| 第 1—15 天 | 选任务、画流程、建立基线、完成风险分级 | 用途卡、流程图、风险登记、指标方案 | 临床、信息、安全和管理共同批准 |
| 第 16—35 天 | 字段/接口/权限准备,回顾性验证 | 数据字典、测试报告、错误与亚组分析 | 没有未解释的高严重度错误 |
| 第 36—55 天 | 实时静默运行和逐例复核 | 接口、延迟、错配、漂移与工作流报告 | 达到预设门槛且原流程可随时接管 |
| 第 56—75 天 | 少数用户、科室和人群受控试点 | 人工动作、患者影响、事件和可用性记录 | 安全、告警和支持负担可接受 |
| 第 76—90 天 | 独立评审,决定扩大、修改、继续观察或退出 | 评审纪要、版本冻结、监测和回滚计划 | 不是以项目投入为由默认通过 |
会议材料至少应包含:版本与知识库清单、未解决错误、关键亚组表现、人工拒绝原因、患者安全事件、接口失败、支持工单、数据访问异常、成本和原流程对照。项目团队要允许结论是“暂不扩围”或“停止”,不能把上线当作唯一成功。
上线后监测:不要只看使用量和采纳率
| 监测层 | 建议看板 | 触发动作 |
|---|---|---|
| 数据 | 缺失、错配、分布变化、设备与接口版本 | 修复数据;必要时限制或停用 |
| 模型/规则 | 错误类型、校准、拒答、引用、亚组差异 | 逐例复盘、调阈值或回到验证 |
| 人机协作 | 查看、理解、接受、修改、拒绝及原因 | 改界面、培训、减少或重排告警 |
| 患者路径 | 处置时间、复诊、转诊、随访、延误和伤害 | 修复流程或立即停用相关功能 |
| 运行 | 可用性、延迟、重复写入、回滚和支持负担 | 降级到原流程、供应商整改 |
| 安全 | 越权、异常导出、分包变更、泄露和删除失败 | 隔离、撤权、应急响应与必要报告 |
模型更新不应默认等同软件修补。只要模型、阈值、提示、知识库、输入设备、数据映射、目标人群或工作流发生可能影响输出的变化,就应做影响分析,并回到相应的回顾性或静默门禁。医院应保留每一次输出对应的模型、提示、知识、接口和配置版本。
实施效果不能脱离科室环境和组织条件
同一个系统在 A 医院有效,不代表在 B 医院自动有效。病例构成、设备、转诊能力、值班安排、医生经验、告警队列和患者沟通方式都会改变最终结果。一项关于临床 AI 实施评价的npj Digital Medicine 研究指出,真实临床评价不能只确认算法有效性,还需要理解影响实施成败的情境因素。医院因此应把“模型表现”和“部署环境”作为两个同时变化的对象记录。
扩围前要比较试点与新科室的差异:输入设备和字段是否一致,目标人群是否新增儿童、孕产妇、罕见病或多病共存患者,人工复核队列是否仍能及时处理,原流程是否相同,培训与现场支持是否足够。若这些条件改变,就不能简单复制试点阈值和结论,应补做分层验证或重新进入静默运行。
项目评审也要允许“没有显著改善”这一结果。没有改善可能说明模型价值有限,也可能说明输出时机、界面、职责或后续处置链断裂。团队应先定位失败发生在数据、模型、人机交互还是服务流程,再决定修改、缩小范围或退出,不能为了证明采购正确而只挑选有利指标。
必须立即暂停的红线
| 红线 | 立即动作 | 恢复前证据 |
|---|---|---|
| 错误患者匹配、关键数据串联或自动写错病历 | 停止写入和个体建议,保全日志并排查影响 | 身份/接口修复、历史核查和回归测试 |
| 漏掉急症、禁忌或可能造成直接患者伤害 | 优先处置患者,停用相关功能并启动事件流程 | 根因、影响范围、纠正措施和临床批准 |
| 关键人群、设备或科室表现明显下降 | 限制适用范围或退回原流程 | 分层再验证和明确新边界 |
| 用户不能理解、拒绝或覆盖 AI 输出 | 停止真实使用,重做界面与流程 | 可用性测试、培训和责任闭环 |
| 权限、日志、数据流、供应商访问或删除失控 | 隔离系统、撤销访问、启动安全响应 | 审计、整改、管理批准和必要报告 |
| 重大版本变更未经复验 | 冻结旧版或停止功能 | 变更说明、本地验证和正式批准 |
常见问题
医院应该先做诊断 AI,还是先做文书 AI?
没有统一答案,但首个项目通常更适合选择可在写入前人工核对、已有数据、错误可恢复的任务。文书 AI 也不是天然低风险:如果把编造内容自动写入病历、错误编码影响收费或质控,同样需要严格门禁。应用四维评分卡,而不是按技术名称排序。
准确率达到多少才可以上线?
没有适用于所有任务的统一百分比。阈值取决于预期用途、患病率、错误后果、人工复核能力和替代流程。总体准确率还可能被多数正常样本“冲高”。应预先定义任务指标、严重错误上限、关键亚组、工作流和患者路径标准。
私有化部署是否等于合规?
不等于。私有化可能降低部分传输和第三方风险,但仍需合法性、最小化、身份权限、加密、日志、备份、漏洞、内部越权、供应链、模型更新、导出和删除管理。云、本地或混合架构都要以完整数据流和责任为依据。
医生采纳率越高,项目越成功吗?
不一定。高采纳可能来自系统真正有用,也可能来自默认选项、绩效压力或自动化偏误;低采纳可能说明输出差,也可能是界面和时机不对。应记录接受、修改、拒绝和绕过的原因,并与患者结果、错误和工作负担一起解释。
模型只做运营预测,还需要临床治理吗?
风险通常较低,但不能忽略公平和间接患者影响。排班、床位、手术室或转诊资源预测可能改变等待和服务机会,因此要监测不同人群和科室是否被系统性不利对待,并保留人工调整和申诉路径。
医院负责人可直接使用的上线核对表
| 门禁 | 通过标准 | 责任证据 |
|---|---|---|
| 用途 | 一个任务、明确用户/人群/输入/输出/禁用范围 | 预期用途卡和风险登记 |
| 证据 | 监管状态、外部证据和本地验证相互对应 | 说明书、研究与验证报告 |
| 数据 | 患者、字段、单位、时间、来源和版本可追溯 | 数据字典和数据流图 |
| 流程 | 人工能理解、拒绝、升级;原流程可接管 | SOP、可用性测试和演练 |
| 安全 | 权限、日志、第三方、事件、备份和删除到位 | 安全评估与合同附件 |
| 运行 | 性能、亚组、工作流、患者路径和事件持续监测 | 看板、例会和复盘记录 |
| 变更 | 版本可冻结、可回归验证、可回滚 | 变更影响分析与批准记录 |
| 退出 | 可停用、迁移、导出、删除并恢复原流程 | 退出演练和删除证明模板 |
真正可上线的医院 AI,不是“模型能回答”,而是医院能证明:输入来自正确患者,输出在限定范围内可靠,正确的人会在正确时间复核,错误能够被发现和纠正,系统故障不会阻断医疗,数据和版本可以追溯,必要时能立即回到原流程。
延伸阅读:诊断证据请看AI 医疗诊断临床验证;县域协同请看基层医疗 AI 落地指南;高风险治疗规划请看AI 放疗计划上线清单;通用安全治理请看AI 安全威胁模型。本站来源、更新和纠错原则见关于兰塞 AI 与编辑规范。
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 19 日重写。旧稿中无法核验的“诊断效率提升 30%”、匿名三甲医院、4.5 个月回本、营收成本、医生患者引语和“我们调研/实战”叙述已全部撤回;新版依据国家卫生健康委、WHO、DECIDE-AI、FUTURE-AI 与临床实施研究,改为场景选择、预期用途、分阶段验证、指标、采购、监测和停用的可执行框架。
