醫學 AI 投稿案 · 前置治理完成
Failure Shape Transfer Across Cloud, Local, and Agentic LLMs in Sequential Clinical Reasoning — Governance Package
原文:治理文件包(索引 + 病例協議 + 預先註冊)
19 頁 · 631 KB · PDF
研究尚未開始,所以沒有結果稿。這份是開工前鎖定的治理文件。
開啟 →這一篇沒有結果可以報,因為實驗還沒開始。收進來是因為它示範了另一半的研究工作:在產生任何資料之前,把會毀掉整個研究的問題先找出來。這一半通常沒人展示,但它決定了研究能不能發表。
題目是:雲端、本機、代理型三類大語言模型,在序貫臨床推理任務上的失效形狀會不會互相轉移,用台灣特有的臨床病例情境做多階段評測。
「失效形狀(failure shape)」的意思是:不同模型犯的錯是不是同一種錯。如果是,那麼用一個模型當守門員去檢查另一個模型就沒有意義 —— 這對任何要在醫院部署 AI 的人都是直接相關的問題。
目標期刊 npj Digital Medicine。已建立 20 篇分級文獻庫(TIER 1 核心撞題 / TIER 2 方法學 / TIER 3 隱私政策),每篇同時保留 PDF 與可搜尋的 Markdown。
每一份都是可交付的文件,不是待辦清單。
| # | 文件 | 解決什麼問題 |
|---|---|---|
| 01 | NYCU IRB 判定申請信(中/英) | 用「determination request」而非「豁免」的正確定位 |
| 02 | 北榮 IRB 兩階段申請大綱 | 第二階段若涉及真實資料的合規路徑 |
| 03 | 審閱者角色界線契約 | 合作者的角色邊界寫成契約並簽署,避免資料來源汙染 |
| 04 | 病例建構協議(v1 鎖定) | 逐步規則:來源限制、去識別、真實性檢查、盲化 |
| 05 | 病例 JSON Schema(v1 鎖定) | 機器可驗證的格式,不靠人眼檢查 |
| 06 | 來源溯源帳本範本 | 每一個病例一列,記錄它的來源與衍生程度 |
| 07 | OSF 預先註冊範本 | 在任何模型推論之前提交,主張與分析計畫鎖死 |
關鍵時序:協議鎖定 → 建構病例 → 盲化審閱 + schema 驗證 → 鎖檔 → OSF 預先註冊 → 才開始跑模型。預先註冊必須在第一次推論之前完成,否則「事後選一個好看的分析」這條路就打開了。
七份文件對上十七個審查發現。移除文件 04,三個致命問題會同時亮紅。
用 Codex(GPT-5.5)當敵意審查者,逐條攻擊治理設計。
審查結果:4 個致命(🔴)+ 11 個警告(🟡)+ 2 個風格(🔵)。四個致命問題全部在動工前被修掉:
🔴 1|IRB 的框架用錯了
原本的敘述框架接近「規避 IRB」,這在審稿與倫理審查上都是致命的。
改用「determination request(判定申請)」的正確語言 —— 主動請 IRB 判定本研究是否屬於人體研究,而不是自己宣稱不需要。
🔴 2|資料來源的授權條件不一致
從公開文獻庫取得的個案報告,授權條件因來源而異,不能一體當成可自由使用。
完全排除以個案報告為主要來源。
🔴 3|個案報告的知情同意不具傳遞性
原作者取得的同意,不自動涵蓋我把它改寫成研究材料的用途。
協議加上來源限制,溯源帳本加一欄標記「實質衍生」程度。
🔴 4|某個工具鏈接觸真實病人資料會違反法規
原本規劃使用的一個外部工具,若接觸真實病人資料會違反個資法相關條文。
該工具完全排除在流程之外。
11 個警告也全部對應到文件修改,包括:真實性評分的循環論證(改為盲化)、對抗式過擬合(改為預先註冊並鎖檔)、次領域樣本數不足(預先註冊聲明不做次領域宣稱)等。
研究治理不是行政瑣事,它跟統計一樣需要被對抗檢查。
整包治理文件用同一套邏輯生產:先寫可否證的規則(不是原則宣示)、把規則寫成機器可檢查的形式(JSON Schema)、然後交給一個敵意審查者逐條攻擊,每一砲對應一份文件的修改。
「規則要可機器檢查」這一條很實際:病例格式用 JSON Schema 定義,驗證是跑腳本不是人眼掃;30 個病例是否都通過真實性門檻,是可以 grep 出來的事實,不是「我覺得都還可以」。
誠實說明它為什麼還沒有結果。
卡在關鍵路徑
IRB 回覆、審閱者契約簽署、OSF 預先註冊提交 —— 這些都是外部依賴,不是我一個人能推完的。
刻意不往前衝
在預先註冊完成之前跑任何模型推論,就會失去「主張是事前鎖定的」這個最重要的可信度來源。所以寧可停著。
醫學 AI 研究最貴的錯誤不在分析階段,在開工之前。把治理設計也放進對抗審查的軌道,等於在還沒花任何成本的時候就先付掉一次退稿。
PROJECT 12 · 臨床推理研究治理包