FDA AI 器械 TPLC:數據、模型與驗證術語
FDA 草案對數據管理、模型描述與開發的期望,以及 FDA「驗證」與 AI 社群用語的關鍵差異。

對 AI 器械,模型是作用機制的一部分。FDA 草案因此大量著墨數據管理、模型描述與開發及清晰的驗證術語。香港臨床人員評估供應商證據時應理解這些區別——市場材料常使用與監管定義不符的 AI 研究用語。
數據管理
數據管理實踐——數據如何收集、處理、標註、儲存、控制及使用——至關重要,因 AI 性能高度依賴數據質量、多樣性及數量。
申報關鍵主題
數據收集應描述場所、時間段、納入/排除標準、真實世界數據(RWD)適用性評估、質量保證、數據集規模、多樣性納入機制,以及任何合成數據及理由。
數據清洗與處理須有開發數據的文件記錄。測試數據僅應以便於代表真實世界預期用途的方式處理,並與最終 AI-DSF 預處理一致。
參考標準(真值)應反映臨床任務,並有建立方法、不確定性、模稜兩可案例處理及臨床醫生評分方案(包括盲法及觀察者間/內變異)的文件。
數據標註應描述標註者專業知識、指引、質量/一致性評估及修正計劃。
開發與測試數據的獨立性至關重要。測試數據一般應來自與訓練不同的場所、與開發者隔離,並支持穩健的外部驗證。數據洩漏會夸大報告性能。
代表性須解釋數據如何反映預期使用人群——疾病譜、人口統計(性別、年齡、種族、族裔)、採集設備及臨床環境。應提供亞群分析及協變量分布。使用美國以外(OUS)數據時,申報人應解釋與目標人群及醫療實踐的可比性。
偏見與混淆
FDA 強調 AI 偏見——系統但有時不可預見的錯誤結果——可來自非代表性訓練數據、混淆因素(如所有病例均在同一掃描器成像)或代表不足亞群。開發與驗證數據中的相同混淆因素可隱藏虛假關聯。
對香港環境,應查詢驗證是否包括亞洲或本地人群、多樣採集設備及多個場所——而非僅以美國為中心的數據集。
模型描述與開發
軟件描述應使具能力的 AI 從業者理解每個模型:
- 輸入、輸出、架構、特徵、特徵選擇、損失函數、參數
- 可定制的技術元素及輸入數據質量控制
- 預處理、後處理、增強或合成方法
模型開發文件應涵蓋訓練方法、範式(監督、聯邦等)、正則化、超參數、收斂曲線、調參評估、預訓練模型、集成方法、閾值/操作點選擇及輸出校準。
多模型組合時,鼓勵提供輸出如何合併為器械輸出的圖示。
對部署後更新的模型,FDA 鼓勵早期Q-Submission溝通及查閱 PCCP 指引。
驗證術語:FDA 與 AI 社群
本指引明確解決術語衝突:
| 術語 | FDA / 器械語境 | AI 研究常見用法 |
|---|---|---|
| 驗證(validation) | 以客觀證據確認預期用途要求能持續達成(21 CFR 820.3(z)) | 有時指開發中的調參或 hold-out 測試 |
| 開發(development) | 訓練、調參及調參評估(「內部測試」) | 概念大致相同 |
| 測試數據 | 用於驗證及確認——不屬開發 | 常與 ML 流程中的「驗證集」重疊 |
申報實務規則: 不要用「驗證」描述訓練或調參。性能驗證是在具臨床相關性條件下以獨立數據集評估模型。
模型版本歷史
申報應記錄受測模型版本、與發布版本的差異,以及防止未經監管同意對測試數據作 post-hoc 調整的保障。在適用 UDI 規則時,新模型版本可能需要新 UDI。