Hong Kong Healthcare Artificial Intelligence Society香港醫療人工智能學會

FDA AI 器械 TPLC:數據、模型與驗證術語

FDA 草案對數據管理、模型描述與開發的期望,以及 FDA「驗證」與 AI 社群用語的關鍵差異。

醫療器械驗證的臨床數據流程與 AI 模型開發

對 AI 器械,模型是作用機制的一部分。FDA 草案因此大量著墨數據管理模型描述與開發及清晰的驗證術語。香港臨床人員評估供應商證據時應理解這些區別——市場材料常使用與監管定義不符的 AI 研究用語。

數據管理

數據管理實踐——數據如何收集、處理、標註、儲存、控制及使用——至關重要,因 AI 性能高度依賴數據質量、多樣性及數量。

申報關鍵主題

數據收集應描述場所、時間段、納入/排除標準、真實世界數據(RWD)適用性評估、質量保證、數據集規模、多樣性納入機制,以及任何合成數據及理由。

數據清洗與處理須有開發數據的文件記錄。測試數據僅應以便於代表真實世界預期用途的方式處理,並與最終 AI-DSF 預處理一致。

參考標準(真值)應反映臨床任務,並有建立方法、不確定性、模稜兩可案例處理及臨床醫生評分方案(包括盲法及觀察者間/內變異)的文件。

數據標註應描述標註者專業知識、指引、質量/一致性評估及修正計劃。

開發與測試數據的獨立性至關重要。測試數據一般應來自與訓練不同的場所、與開發者隔離,並支持穩健的外部驗證。數據洩漏會夸大報告性能。

代表性須解釋數據如何反映預期使用人群——疾病譜、人口統計(性別、年齡、種族、族裔)、採集設備及臨床環境。應提供亞群分析及協變量分布。使用美國以外(OUS)數據時,申報人應解釋與目標人群及醫療實踐的可比性。

偏見與混淆

FDA 強調 AI 偏見——系統但有時不可預見的錯誤結果——可來自非代表性訓練數據、混淆因素(如所有病例均在同一掃描器成像)或代表不足亞群。開發與驗證數據中的相同混淆因素可隱藏虛假關聯。

對香港環境,應查詢驗證是否包括亞洲或本地人群、多樣採集設備及多個場所——而非僅以美國為中心的數據集。

模型描述與開發

軟件描述應使具能力的 AI 從業者理解每個模型:

  • 輸入、輸出、架構、特徵、特徵選擇、損失函數、參數
  • 可定制的技術元素及輸入數據質量控制
  • 預處理、後處理、增強或合成方法

模型開發文件應涵蓋訓練方法、範式(監督、聯邦等)、正則化、超參數、收斂曲線、調參評估、預訓練模型、集成方法、閾值/操作點選擇及輸出校準。

多模型組合時,鼓勵提供輸出如何合併為器械輸出的圖示。

對部署後更新的模型,FDA 鼓勵早期Q-Submission溝通及查閱 PCCP 指引。

驗證術語:FDA 與 AI 社群

本指引明確解決術語衝突:

術語FDA / 器械語境AI 研究常見用法
驗證(validation)以客觀證據確認預期用途要求能持續達成(21 CFR 820.3(z))有時指開發中的調參或 hold-out 測試
開發(development)訓練、調參及調參評估(「內部測試」)概念大致相同
測試數據用於驗證及確認——屬開發常與 ML 流程中的「驗證集」重疊

申報實務規則: 不要用「驗證」描述訓練或調參。性能驗證是在具臨床相關性條件下以獨立數據集評估模型。

模型版本歷史

申報應記錄受測模型版本、與發布版本的差異,以及防止未經監管同意對測試數據作 post-hoc 調整的保障。在適用 UDI 規則時,新模型版本可能需要新 UDI。

來源:美國 FDA — 人工智能醫療器械軟件功能:生命週期管理與上市申報建議(2025 年 1 月,草案指引

準備好測試你的理解?

根據本文進行短測驗,檢視你的理解程度。

開始測驗