Overlap Governance Template: The Envelope-Thinking Playbook for AI-Managed AI Projects
首篇的三个场景(AI 生成验证方案、AI 预测偏差、AI 辅助写测试计划)在项目组里天天发生。但每次发生,现场都卡在同一个问题上:这算不算项目记录?谁来签字?AI 工具换了个版本,之前的东西还有效吗?
独立质量专家 Jeremiah Genest 把这层叫「被监管的缺失中间地带」——Annex 22 第一次为它立了规矩,但规矩是「要求」层面的:关键决策须有人类监督。要求有了,工具没有。另一篇文章说得更透:传统计算机化系统验证(CSV)的四个前提都假设「系统静止不动」,AI 不满足——验证会变成治理行为。「治理行为」落到日常,就是登记、划界、触发。三件事,三张卡。
| 来源 | 是什么 | 给模板什么 |
|---|---|---|
| FDA PCCP(2025-08 最终指南) | 允许对 AI/ML 模型事先划「可接受的变更包络」,包络内一次审批、包络外才重新申报 | 「事前划界」的方法:把「什么算计划内」写死 |
| EU GMP 附录 22 草案 §10.1 | 每次变更评估是否重测,不重测得论证 | 「事后触发」的门:包络外必须走 |
| MLOps(再训练触发 + 模型注册表) | 工程侧对「漂移/版本」的自动检测与登记 | 「触发信号」怎么定义、登记表怎么建 |
表 1 | 三个来源与贡献。合成规则一句话:包络内免测、包络外触发、全生命周期登记(图 1)。企业实践里,Sander Timmer 在 GSK 的「Registry of Truth」(13 个关键产品主动漂移检测)证明这套思路在规模上可行——注意:他现为 Novartis AI 负责人,属利益相关方,只作实践佐证。
用途:AI 管 AI 项目的每一个动作,都有一行记录。这是「留痕」铁规矩的载体。
| 字段 | 说明 |
|---|---|
| 动作编号 | AI-{项目}-{序号},如 AI-ANX-001 |
| 项目/阶段 | 对应「角色 × 项目阶段矩阵」的格子 |
| 工具(模型+版本/提示词版本) | 精确到版本号——「可回溯」的起点 |
| 输入数据 | 指向的数据集/文档集(引用 ID) |
| 输出去向 | 三选一:① 项目记录(需人审签字)② 风险评估/草稿(人复核)③ 纯辅助(人自用) |
| 复核人 | 签名 |
| 包络判定 | 新建 / 包络内 / 包络外(包络外须触发卡 3) |
卡 1 | 工具登记表字段。规则:输出去向 = ① 时该行按项目记录管理(进变更控制、长期保留);= ② 按草稿管理(保留到项目关闭);= ③ 不进记录。若后期从 ③ 升级为 ①,回补合规登记——这正是「把工具当对象」错位的纠正点。
用途:对登记表里的每个「工具动作」,事先定义「计划内的变化」。定义好后由 QA 负责人一次审批,此后包络内变更免走重测。
| 字段 | 示例 |
|---|---|
| 工具动作 | AI 辅助生成验证方案(AI-ANX-001) |
| 包络内允许的变化 | ① 同一模型 ±0.1 个百分点内的微小重训;② 提示词文字性微调(不改结构);③ 模板补丁 |
| 包络内动作 | 登记即可(卡 1 更新版本号),免重测 |
| 包络外(触发) | 模型版本跳变(主版本号变化);提示词结构重写;数据集更换;输出角色升级(草稿→记录);漂移超阈 |
| 审批人/日期 | QA 负责人 / 版本化 |
卡 2 | 包络定义卡字段。设计要点:包络定义必须具体到可判断(「±0.1 个百分点」「文字性微调」),不能写「小幅调整」——模棱两可的包络等于没有包络。PCCP 的原文逻辑也是这样:范围预先写死,才有「一次审批」的资格。
| # | 触发事件 | 对应动作 |
|---|---|---|
| 1 | 漂移超阈(性能/输入样本空间) | 评估重测;进偏差/变更控制(附录 22 §10.3–10.4) |
| 2 | 训练数据源更换/新增 | 评估重测(§10.1)——数据变了,模型结论的「证明」要重验 |
| 3 | 模型主版本跳变 | 评估重测;工具登记表更新版本链 |
| 4 | 提示词结构重写 | 评估重审(工具身份的「人复核」要求重走) |
| 5 | 输出角色升级(草稿→记录) | 重点:走「对象」验收(证据链按 ALCOA+ 最小字段集补齐)——错位纠正的核心场景 |
卡 3 | 包络外触发清单。为什么列这五条:分别对应附录 22 草案的运行期义务(10.3/10.4 漂移、10.1 变更、6.5 四眼)与工具身份义务(人复核)。五条之外的变化属于包络内——这是「包络」省下的行政成本;五条之内,一条都不能省。
场景 A:AI 生成验证方案(AI-ANX-001)。登记行:输出去向 = ① 项目记录;复核人 = 验证负责人;包络判定 = 新建。包络卡:允许「提示词文字性微调」;模型版本跳变 → 触发。执行:方案定稿人签;AI 痕迹(版本、提示词、输出)按字段归档;下一次生成若换了模型主版本 → 触发清单 #3 → 评估重审。三张卡各逐项核验一遍,三分钟完成。
场景 B:AI 预测偏差趋势(AI-ANX-002)。登记行:输出去向 = ② 风险评估;包络判定 = 新建。边界点:预测不进记录;人决定开偏差调查,调查本身是对象记录(另立流程)。执行:预测报告标「风险评估」,附模型版本与置信度;若预测用作调查依据 → 角色升级 → 触发清单 #5 → 按对象补齐证据。升级就必须补证据——这正是 FDA 警告信的教训在工具侧的镜像。
场景 C:AI 辅助写测试计划(AI-ANX-003)。登记行:输出去向 = ① 项目记录(测试计划是对象记录);复核人 = 测试负责人;四眼:写计划人与应用结果人分开(附录 22 §6.5 等价)。包络卡:提示词微调归内;AI 工具更换 → 触发清单 #3 → 评估「生产管线」变化对计划的影响。模板不增加行政负担——它把说不清变成三分钟填完。
1. 模板不是再造体系。它就是现有变更控制的「AI 前置卡」:进 QMS 时挂到变更控制流程的第一个动作位,不新增审批层级。行业已有教训:新设「中央 AI 治理委员会」正被批评失效、层层加码不解决问题——加卡不加层。
2. 附录 22 仍是草案,EMA 正重估 LLM 条款(约 1,350 条意见;EFPIA/ISPE/PDA 主张「技术中立、结果导向;高风险≠禁止,应加强控制与监督」)。若定稿把「人类监督充分」的用例纳入可接受范围,只需改卡 2 的「准入行」——模板结构不变。
3. 模板 v0.1:只覆盖「工具动作」级;多智能体协同(Agentic AI 管多个 AI)、联邦学习等场景,需在定稿后扩展(预留字段:卡 1 的「工具」列已支持多行引用)。
4. 场景为抽象示例(匿名合规,不举现雇主案例)。
交叠层的道理,首篇讲完了。本文给它配了工具:一张登记表、一张包络卡、一张触发清单。三张卡合计约五页纸,却能回答项目组每天都要问的三个问题:是否计入记录、由谁签字、版本变更后的有效性。
下一篇建议:角色③专文(AI 管 AI:从「代理建模代理」到 GxP 治理)——学术空白、无治理模板、中文无论述,三空白叠加,值得专文。