直接答案:AI 已经可以辅助放射治疗计划中的影像分割、危及器官与部分靶区勾画、剂量分布预测、优化目标建议、计划生成和在线自适应流程,但“自动生成”不等于“自动批准并照射”。每一份临床计划仍要在明确预期用途内,由放射肿瘤科医师、医学物理师和剂量师核对患者、处方、靶区、危及器官、剂量体积约束、机器可交付性和质量保证结果。AI 最成熟的价值是减少重复劳动、提供一致的计划起点和暴露异常,而不是替患者选择治疗方案。

医疗提示:本文用于解释技术、证据、监管和医院质量保证,不提供个人癌症治疗建议。具体是否需要放疗、照射部位、总剂量、分次和联合治疗,必须由具备资质的临床团队根据病理、分期、影像、身体状况和现行指南决定。资料复核日期为 2026 年 7 月 19 日;产品适用范围、注册状态和质量标准可能更新,采购或使用前应查询所在地监管数据库、注册证和最新版说明书。
先分清:AI 放疗计划不是 AI 诊断,也不是自动开处方
放射治疗计划把医生处方和患者影像转化为机器可执行的照射方案。典型流程包括模拟定位、影像配准、靶区和危及器官勾画、束流或弧设计、剂量计算与优化、计划评估、独立复核、患者特异质量保证、治疗前核对和分次交付。AI 可以为其中某一步生成候选输出,却不能由此推导出患者应该接受何种治疗。若要了解“筛查、检测、诊断和预测”的区别,可先阅读AI 医疗诊断的临床验证与上线清单。
| 环节 | AI 可提供 | 最终责任 | 不能自动推出 |
|---|---|---|---|
| 影像分割 | 器官、肿瘤或辅助结构候选轮廓 | 医生/授权人员复核与修改 | 病理诊断和完整靶区定义 |
| 剂量预测 | 可能达到的三维剂量或 DVH 目标 | 物理师/剂量师在 TPS 中验证 | 处方是否适合该患者 |
| 计划优化 | 目标、权重、束角或候选计划 | 临床团队审查取舍 | 计划已安全、可交付 |
| 计划评估 | 异常提醒、基准和替代方案 | 医生与物理师签署 | 长期肿瘤控制和毒性结局 |
| 在线自适应 | 每日轮廓、重算或重优化草案 | 在线团队限时复核 | 可以跳过身份、影像和剂量 QA |
IAEA《Clinical Implementation of Artificial Intelligence Systems in Radiation Oncology》把 AI 放疗视为一个需要数据、验证、工作流、人员培训、风险管理和持续监测共同支撑的临床系统;IAEA《Artificial Intelligence in Medical Physics》强调临床合格医学物理师在安全实施中的作用。两者都不支持“装上模型即可自动治疗”的营销叙事。
四类 AI 能力的成熟度并不相同

| 能力 | 主要输入 | 主要输出 | 证据重点 | 主要失败 |
|---|---|---|---|---|
| 自动勾画 | CT/MR、序列和方向信息 | OAR/靶区轮廓 | 临床可用性、编辑量、剂量影响 | 漏层、错器官、边界偏移 |
| 剂量预测 | 影像、结构、处方和几何关系 | 三维剂量或可达目标 | 靶区覆盖、OAR 剂量、校准 | 超训练分布、不可达目标 |
| 自动计划 | 结构、处方、协议和机器模型 | 束流、目标、优化后计划 | 与人工计划比较、可交付性、QA | 表面达标但隐藏热点或复杂度 |
| 在线自适应 | 当日影像、形变和累积剂量 | 当日轮廓与适应计划 | 端到端时限、运动、故障和累计剂量 | 时间压力下自动化偏差 |
自动勾画:最成熟,但绝不能只看 Dice
自动勾画通常先在 CT 或 MR 上生成危及器官(OAR)和部分靶区轮廓,医生再检查、编辑和批准。它对重复、边界相对稳定的器官最有帮助;术后解剖改变、巨大肿瘤、金属伪影、视野不全、特殊体位、罕见病例和不同扫描协议更容易超出训练分布。FDA 对一款放疗器官自动分割软件的510(k) 摘要明确说明其输出供合格专业人员使用,产品不是独立诊断或临床决策软件。监管文本中的这种限定,比“AI 自动画器官”更接近真实边界。
几何指标只能描述两个轮廓有多像。Dice 对小器官和局部边界不敏感;Hausdorff 距离容易受极端点影响;平均表面距离可能掩盖靠近高剂量梯度的关键偏差。真正的临床评估还要问:医生需要改多少、哪里改、编辑后用了多久、差异是否改变 DVH、是否导致靶区欠覆盖或危及器官超限,以及异常病例能否被识别。
| 自动勾画指标 | 回答的问题 | 不能独立证明 |
|---|---|---|
| Dice/体积 Dice | 轮廓体积重叠程度 | 关键边界和剂量影响 |
| 表面 Dice | 容差范围内表面一致性 | 容差是否适合该器官 |
| Hausdorff 距离 | 最坏表面偏差 | 偏差是否处于高剂量区 |
| Added Path Length | 人工需要重画多少边界 | 最终轮廓的临床正确性 |
| 编辑时间 | 实际工作量是否下降 | 剂量与患者结局不受影响 |
| 剂量重算 | 轮廓差异对计划剂量影响 | 整个治疗路径已安全 |
一项前列腺放疗临床实施研究发现,自动轮廓带来中位 12 分钟的医生时间节省,但 43 个反馈病例中仍有 33% 需要“临床显著”的大幅编辑,而且几何指标不能可靠识别这些病例,见临床实施研究全文。这正说明医院不能设置“Dice 达标即免审”的错误规则。
不同中心的收益也可能差异很大。四中心评估中,前列腺和头颈部的节时幅度随既有流程而变,见多中心深度学习勾画研究;随机分配 97 名放射肿瘤科医生的 ELAISA 研究还显示,教学与 AI 辅助的组合会影响时间和轮廓质量,见ELAISA 研究。因此“模型能力”和“人员培训”不能分开验收。
剂量预测:是计划参考,不是处方决定
剂量预测模型可以根据患者解剖、靶区、处方和历史高质量计划,估计三维剂量分布或危及器官可达到的剂量目标。它适合回答“在类似几何条件下,某个 OAR 是否还有下降空间”,帮助发现人工计划过于保守或不现实的优化目标。但它不能替医生决定治疗适应证、总剂量、分次或风险取舍。
FDA 2025 年 K250064 文件中的 Dose+ 是一个清晰案例:它面向接受外照射的特定前列腺癌患者,用锁定模型生成三维剂量预测,输出必须传入 TPS 或 DICOM-RT 软件审查;文件还明确写明它不用于疾病诊断或治疗决策,见FDA 510(k) 原文。因此不能把“FDA 授权的剂量预测软件”改写成“AI 自动决定怎么治”。
| 剂量预测验收 | 最低检查 | 危险误解 |
|---|---|---|
| 适用患者 | 病种、部位、术式、分期、体位和处方匹配 | 前列腺模型可直接用于所有盆腔肿瘤 |
| 输入结构 | 命名、单位、方向、轮廓完整性 | 结构名相同就代表定义相同 |
| 靶区覆盖 | D95、D98、热点和均匀性 | 只看 OAR 降低 |
| OAR 剂量 | 协议指定的 Dmean、Dmax、Vx 等 | 平均剂量低就一定安全 |
| 人工计划比较 | 盲法或预设规则比较质量与迭代 | 模型输出天然是上限 |
| 不可用情况 | 超分布、数据缺失、极端解剖和失败提示 | 任何输入都必须返回结果 |
自动计划:需要同时验证质量、复杂度和可交付性
自动计划可根据协议设置束角、优化目标、权重和迭代策略,生成一个或多个候选计划。中国国家药监局曾公开说明一款创新放疗计划软件获批,其核心包含自动布野和自动计划优化,目的在于减少人工步骤和对使用经验的依赖,同时仍要求上市后监管,见NMPA 官方信息。这证明自动化计划可以成为获批医疗器械功能,但不意味着医院可以跳过验收、剂量计算、在线计划复核或治疗机 QA。
自动计划可能在 DVH 表上通过所有硬约束,却通过增加小子野、监视单位、叶片运动或调制复杂度换取指标。复杂度过高可能增加交付时间、对机器误差的敏感性或患者运动影响。医院必须比较计划质量、稳健性、机器参数、交付日志和患者特异测量,不能把“优化器显示绿色”当作照射许可。
| 人工计划与 AI 计划比较 | 建议方法 | 为什么需要 |
|---|---|---|
| 处方和硬约束 | 相同协议、相同机器模型、相同计算算法 | 避免比较条件不一致 |
| 盲法评分 | 隐去计划来源,由多人独立评价 | 降低对“AI”标签的偏见 |
| 靶区与 OAR | 同时报告覆盖、热点、低剂量浴和关键 OAR | 防止只优化单一指标 |
| 复杂度 | MU、叶片运动、小野、控制点和交付时间 | 评估真实可交付性 |
| 患者特异 QA | 按科室标准测量或独立剂量验证 | 发现计算到交付链路错误 |
| 人工工作量 | 总耗时、编辑、迭代、失败和返工 | 避免只统计模型推理时间 |
FDA 2025 年 ART-Plan+ 文件说明 SmartPlan 可自动生成放疗计划供用户导入自己的 TPS 进行剂量计算和审查,见K242822 510(k) 摘要。同样,自动生成只是工作流的一段;产品注册范围、目标部位、影像模态、TPS 与版本都要逐项匹配。医院可用AI 项目需求、PoC 与验收指南把预期用途、基线和停止条件写成可执行方案。
在线自适应:时间越紧,安全结构越重要
在线自适应放疗根据当日影像和解剖变化重新勾画、重算或重优化计划。AI 能缩短轮廓和计划时间,但患者正在治疗床上等待,团队更容易在时间压力下产生自动化偏差。必须预先规定影像不合格、配准失败、器官运动、轮廓异常、剂量计算超时、网络中断和人员分歧时的降级路径:使用原计划、重新摆位、补充影像、转离线适应或停止本次治疗。
放疗临床实践综述指出,自动分割和自动计划已有真实应用,而在线计划、自适应、伪 CT 和运动跟踪仍涉及泛化、伦理与临床实施挑战。医院不能把研究级的“在线计划生成时间”直接当成全流程患者在床时间;全流程还包括图像获取、配准、轮廓复核、计划评估、独立核查、传输和治疗前确认。
| 在线故障 | 潜在影响 | 预设安全降级 |
|---|---|---|
| 当日影像质量不足 | 配准、轮廓和剂量重算失真 | 重新成像、重新摆位或使用经批准原计划 |
| 自动轮廓越界 | 靶区欠照或危及器官过量 | 人工重勾、转离线评估或停止本次治疗 |
| 重优化超时 | 患者在床时间过长、运动增加 | 执行预设超时点并回到标准路径 |
| TPS/R&V 传输失败 | 错版本、旧计划或参数不一致 | 阻止照射,重新传输并双人核对 |
| 复核人员意见分歧 | 在时间压力下草率批准 | 升级到指定高级人员或改期 |
监管授权证明什么,又不证明什么
监管授权对应的是某个制造商、软件版本、预期用途、患者人群、输入设备、输出和工作流。FDA 的AI-enabled medical device list有助于查找已识别的授权设备,但 FDA 也说明清单并不完整;最终仍要查看具体 510(k)、De Novo 或 PMA 文件。中国采购则要核对国家药监局数据库中的注册证、结构组成、适用范围和说明书,不能仅凭厂商官网写着“AI 医疗”或“国际认证”。
| 证据/文件 | 可以说明 | 不能说明 |
|---|---|---|
| 监管授权 | 特定产品按特定用途获得上市许可 | 公司所有产品都安全有效 |
| 技术验证 | 在指定数据上达到预设性能 | 本院设备、人群和流程必然相同 |
| 临床工作流研究 | 编辑、时间和计划影响 | 长期患者结局一定改善 |
| 论文平均值 | 研究样本中的总体结果 | 每个器官和异常病例都达标 |
| 厂商演示 | 功能和界面可能如何工作 | 独立证据、故障率或净收益 |
国家卫生健康委的GBZ 121—2020《放射治疗放射防护要求》要求医疗机构建立质量保证大纲,覆盖患者固定、肿瘤定位、治疗计划设计、剂量施予、核查、仪器校准、偏差纠正和独立审查;《放射诊疗管理规定》要求验证治疗计划执行情况并处置偏离。AI 是计划工具的变化,不会取消这些责任。
本地验证:先锁定版本和基线,再比较模型
医院验收应在接触结果前写方案:明确产品版本、模型、TPS、剂量计算算法、治疗机、影像设备、部位、协议、处方、主要终点、亚组和停止条件。测试集要与训练/调参数据隔离,并覆盖常见、困难和故障病例。若供应商在看到失败后调整阈值或模型,应建立新的冻结测试或用独立样本复验,不能无限调到通过。
| 验证层 | 对象 | 主要终点 | 通过后仍需 |
|---|---|---|---|
| 离线技术 | 冻结历史病例 | 几何、剂量、失败率、亚组 | 真实流程测试 |
| 回顾性人工计划比较 | 同病例 AI/人工计划 | 盲评、DVH、复杂度、QA | 前瞻影子运行 |
| 前瞻影子运行 | 连续真实患者,不影响治疗 | 时间、编辑、接口、异常 | 有限临床开放 |
| 有限开放 | 限定部位与授权用户 | 净节时、返工、不良事件 | 持续监测和扩围评审 |
| 变更复验 | 模型/TPS/设备/协议更新 | 回归测试和风险差异 | 批准、发布和回滚 |
自动勾画的研究结果不能简单复制。一项 40 例回顾性研究报告,在医生仔细复核后可节省时间且总体计划质量未显著受损,但个别剂量参数仍有差异,见商业自动勾画临床研究。另一项对五家商业系统的共同数据集评估发现总体节时明显,但结构数量、部位与表现存在差异,见五系统比较研究。这些结果适合帮助设计验收,不适合当成本院验收结果。
数据、接口与 TPS 集成是同一个安全问题
AI 放疗输入不只是像素,还包括患者身份、检查 UID、体位、方向、像素间距、层厚、结构命名、处方、分次、机器模型和 DICOM-RT 对象关系。左右翻转、序列选错、旧轮廓复用、结构名映射错误或剂量单位错误,都可能在模型本身“正常运行”时制造危险输出。应建立端到端测试,从模拟定位影像进入系统开始,一直追踪到 TPS、记录与验证系统和治疗机端。
| 接口风险 | 测试病例 | 安全行为 |
|---|---|---|
| 错人/错检查 | 相似姓名、重复扫描、旧检查 | 阻断导入并要求双重核对 |
| 方向/单位 | 头足位、左右侧、mm/cm、Gy/cGy | 显式显示并做范围校验 |
| 结构命名 | 同义词、大小写、空结构、重复结构 | 受控映射,未知名称拒绝自动处理 |
| DICOM-RT 关系 | Structure Set、Plan、Dose 引用不一致 | 验证 UID 链和患者一致性 |
| 版本/缓存 | 新模型配旧结果、回滚后残留 | 结果显示模型、配置和时间戳 |
| 网络/超时 | 上传中断、重复提交、部分返回 | 幂等、校验和、明确失败,不静默补全 |
外包数据处理、标注或模型验证时,应把患者隔离、去标识、访问审计、专家资格、金标仲裁、保留期限和删除证明写入合同,可结合医疗 AI 数据供应商采购与验收与标注平台质量控制指南。任何真实患者影像都不应上传到未经医院批准的公共 AI 工具。
人工复核必须设计成能发现错误,而不是点击确认
自动化偏差会让使用者因为输出看起来整齐、速度快或来自“已获批 AI”而降低警觉。界面应同时显示原始影像、AI 轮廓、修改痕迹、模型版本和失败提示;关键结构可以要求逐层或关键切面确认;不得把“全部接受”设置成最容易的默认动作。复核者还应能记录不同意原因,使常见错误回流到监控,而不是被覆盖后消失。
| 角色 | 最低责任 | 不应被 AI 替代 |
|---|---|---|
| 放射肿瘤科医师 | 适应证、处方、靶区/OAR、临床取舍和批准 | 患者个体化治疗判断 |
| 医学物理师 | 系统验收、剂量算法、计划复核、QA 和变更管理 | 独立物理与交付验证 |
| 剂量师/计划人员 | 计划生成、约束、优化、异常识别和记录 | 专业计划权衡 |
| 放疗技师 | 身份、体位、影像、治疗前核对和交付异常 | 现场安全停机判断 |
| 信息与安全 | 接口、权限、日志、备份、网络和供应链 | 临床内容批准 |
| 质量治理团队 | 事件、漂移、审计、培训和停用决定 | 一线临床签署 |
可用性测试要覆盖夜班、跨科室、异常患者、网络抖动、计划软件卡顿和治疗前临时修改,方法可参考AI 产品可用性测试与失败恢复。高风险工作流还应结合AI 失效、攻击和系统性影响分析与AI 安全全生命周期指南建立事件分级和应急演练。
患者特异 QA:AI 计划不能因为“像历史计划”而免检
患者特异质量保证的目标是确认计划软件输出能够由具体治疗机按可接受精度交付。是否需要测量、独立剂量计算或基于日志的验证,应按技术类型、科室方案、监管要求和风险评估执行。AI 可以协助预测 QA 风险或筛选异常,但不能用同一模型的自我判断替代独立验证。
| QA 层次 | 核对内容 | 典型触发停止 |
|---|---|---|
| 患者与处方 | 身份、部位、分次、总剂量和批准 | 任何不一致 |
| 计划内容 | 靶区、OAR、DVH、热点、图像和等中心 | 硬约束或临床目标失败 |
| 机器参数 | 能量、机架、准直器、MLC、MU 和附件 | 超机器或协议范围 |
| 独立计算/测量 | 剂量一致性、空间一致性和异常解释 | 未达科室阈值且无批准处置 |
| 传输与记录 | TPS 到 R&V/治疗机对象一致 | 版本、UID 或参数漂移 |
| 治疗前核对 | 体位、影像、等中心和当天变化 | 无法解释的偏差 |
国家卫生健康委对医用电子直线加速器质量控制的解读指出,非所需剂量可能伤害患者,设备需要验收、状态与稳定性检测,见官方标准解读。AI 计划引擎提高自动化程度后,反而更需要明确独立检查点,防止同一错误快速复制到更多患者。
90 天医院试点:从离线到有限临床开放
| 阶段 | 主要工作 | 必须产出 | 继续条件 |
|---|---|---|---|
| 第 1–15 天 | 核对注册、用途、版本、接口与责任 | 用途卡、风险清单、数据流和 RACI | 与本院部位、设备和人员匹配 |
| 第 16–30 天 | 冻结测试集、协议和人工计划基线 | 统计方案、难例、亚组与停止条件 | 无训练/调参泄漏 |
| 第 31–50 天 | 离线技术与端到端验证 | 几何、剂量、接口、失败和 QA 报告 | 达到预设门槛 |
| 第 51–70 天 | 前瞻影子运行,不影响临床计划 | 总时间、编辑、返工、故障与复盘 | 净收益为正且错误可控 |
| 第 71–85 天 | 限定部位、人员和时段开放 | 双签、事件、人工计划对照和回滚演练 | 连续稳定且人员胜任 |
| 第 86–90 天 | 治理委员会决策 | 上线、整改或停止记录 | 监控、预算、培训长期可持续 |
试点不能只报告“模型推理 30 秒”。真正有价值的是从影像可用到计划批准的总历时、人员主动操作时间、编辑与返工、失败率、计划质量、患者特异 QA、异常恢复和临床容量。2024 年一篇实施综述同样强调训练数据、泛化、偏倚、工作流、解释和使用者信任,见AI 放疗计划从回顾性承诺到临床现实。
采购合同和变更控制必须能约束模型
| 条款 | 供应商应提供 | 医院应保留 |
|---|---|---|
| 产品身份 | 注册证、模块、模型、版本、预期用途和禁忌 | 逐版本验收权 |
| 证据 | 数据分布、指标、亚组、失败、临床和剂量影响 | 本地独立测试权 |
| 接口 | DICOM-RT、TPS、R&V、设备与兼容矩阵 | 端到端测试和拒收权 |
| 更新 | 变更日志、影响评估、通知期和回归测试 | 拒绝升级、并行验证和回滚权 |
| 数据 | 用途、地域、分包、保留、训练使用和删除 | 导出、审计、退出和删除证明 |
| 服务 | SLA、容量、灾备、故障和安全事件通报 | 离线降级和持续治疗方案 |
| 退出 | 结构、计划、日志、配置和接口迁移 | 不被供应商锁定 |
静默更新是高风险红线。模型、后处理、轮廓命名、阈值、计划软件、剂量算法、机器模型或 DICOM 接口任一变化,都可能改变临床输出。医院应按影响分级决定是否重新做离线回归、端到端、患者特异 QA 和有限影子运行。内容与证据材料也应经人工审核流程复核,不能把供应商新闻稿或内部演示写成“真实临床效果”。
AI 放疗上线六道门禁

| 门禁 | 通过证据 | 红线 |
|---|---|---|
| 预期用途 | 部位、患者、影像、设备、输出和用户匹配 | 超注册范围或把辅助输出当处方 |
| 本地证据 | 难例、亚组、几何、剂量、工作量均达标 | 只用厂商演示集 |
| TPS 与接口 | UID、方向、单位、结构、剂量和版本端到端一致 | 错人、错侧或静默映射 |
| 人工责任 | 逐环节复核、双签、不同意和升级路径明确 | 高风险结果一键批量接受 |
| 质量保证 | 计划复核、独立验证、患者特异 QA 和治疗前核对 | AI 计划默认免检 |
| 持续监测 | 版本、编辑、失败、漂移、事件、停用与回滚 | 上线后无人监控或供应商静默更新 |
患者和家属怎样理解“AI 参与了放疗计划”
患者不需要理解每个算法,但有权知道 AI 用在哪一步、谁审查、数据如何使用以及出错如何处理。可以向治疗团队询问以下问题;回答应具体到本院流程,而不是只有“AI 很先进”。
| 可以询问 | 可信回答应包含 |
|---|---|
| AI 做了什么? | 自动勾画、剂量预测、计划优化或 QA 中的明确环节 |
| 谁批准计划? | 放射肿瘤科医师、医学物理师等具体职责 |
| 是否核对和修改? | 人工检查、编辑、独立计算或测量流程 |
| 适用于我的情况吗? | 部位、影像、设备和产品注册范围 |
| 数据去了哪里? | 本地/云端、保存、第三方、训练使用和删除 |
| 系统失效怎么办? | 人工计划、原流程、暂停、回滚和事件报告 |
常见问题
AI 自动勾画比医生更准确吗?
不能脱离器官、肿瘤部位、影像协议、病例难度和评价方法回答。部分结构平均表现很好,异常解剖或小器官仍可能需要大量修改。医院应同时评估几何、临床编辑、剂量影响和失败识别,最终轮廓由具备资质的人员批准。
AI 生成的放疗计划可以直接照射吗?
不可以把模型输出直接等同照射许可。计划必须进入受控 TPS 与记录系统,完成处方、结构、剂量、机器可交付性、独立复核、患者特异 QA 和治疗前核对。具体流程按当地法规、医院制度和技术类型执行。
获得 FDA 或 NMPA 授权就不需要本地验证吗?
仍然需要。授权对应特定产品和预期用途;本院的患者、人群、影像、TPS、治疗机、协议、人员和接口可能不同。本地验证不是重复监管审评,而是确认产品在本院完整系统中安全工作。
节省勾画时间是否等于治疗效果更好?
不等于。节时可能增加科室容量或让医生投入复杂病例,但患者获益还取决于最终轮廓、计划质量、治疗及时性、执行准确性、毒性和肿瘤控制。应把效率作为一个终点,而不是唯一终点。
生成式大模型能直接制定放疗计划吗?
通用聊天模型可以解释术语或协助整理非敏感材料,但不能被默认当作获批 TPS、剂量计算器或临床计划软件。它可能编造处方、约束和来源,也缺少患者特异剂量与机器模型。真实病历和影像不得放入未经批准的公共模型。
结论:AI 放疗的验收单位是完整计划系统
AI 放疗计划的价值不在“几秒生成”,而在生成的轮廓、剂量和计划能否被专业人员发现错误、正确修改、可靠交付并持续监测。自动勾画相对成熟,剂量预测和自动计划正在进入受监管产品,在线计划与自适应流程则把时间压力、接口和人因风险推得更高。最稳妥的路径是:限定用途、冻结版本、用本院病例比较、先影子运行、保留人工批准、执行独立剂量与患者特异 QA、监测编辑和失败,并保证随时能够降级和回滚。
