← 回總覽 · 13 篇研究

醫學 AI 投稿案 · 前置治理完成

在跑第一次模型推論之前:一份醫學 AI 研究的完整治理包

Failure Shape Transfer Across Cloud, Local, and Agentic LLMs in Sequential Clinical Reasoning — Governance Package

治理文件完成 實驗未啟動 目標 npj Digital Medicine Codex 審出 4 個致命問題

2026-05-10 · 7 份治理文件 · 20 篇分級文獻庫 · 對抗審查抓出 4 個致命 + 11 個警告 + 2 個風格問題

PDF

原文:治理文件包(索引 + 病例協議 + 預先註冊)

19 頁 · 631 KB · PDF

研究尚未開始,所以沒有結果稿。這份是開工前鎖定的治理文件。

開啟 →

這一篇沒有結果可以報,因為實驗還沒開始。收進來是因為它示範了另一半的研究工作:在產生任何資料之前,把會毀掉整個研究的問題先找出來。這一半通常沒人展示,但它決定了研究能不能發表。

01研究本身要做什麼

題目是:雲端、本機、代理型三類大語言模型,在序貫臨床推理任務上的失效形狀會不會互相轉移,用台灣特有的臨床病例情境做多階段評測。

「失效形狀(failure shape)」的意思是:不同模型犯的錯是不是同一種錯。如果是,那麼用一個模型當守門員去檢查另一個模型就沒有意義 —— 這對任何要在醫院部署 AI 的人都是直接相關的問題。

目標期刊 npj Digital Medicine。已建立 20 篇分級文獻庫(TIER 1 核心撞題 / TIER 2 方法學 / TIER 3 隱私政策),每篇同時保留 PDF 與可搜尋的 Markdown。

02開工前要鎖死的七件事

每一份都是可交付的文件,不是待辦清單。

#文件解決什麼問題
01NYCU IRB 判定申請信(中/英)用「determination request」而非「豁免」的正確定位
02北榮 IRB 兩階段申請大綱第二階段若涉及真實資料的合規路徑
03審閱者角色界線契約合作者的角色邊界寫成契約並簽署,避免資料來源汙染
04病例建構協議(v1 鎖定)逐步規則:來源限制、去識別、真實性檢查、盲化
05病例 JSON Schema(v1 鎖定)機器可驗證的格式,不靠人眼檢查
06來源溯源帳本範本每一個病例一列,記錄它的來源與衍生程度
07OSF 預先註冊範本在任何模型推論之前提交,主張與分析計畫鎖死

關鍵時序:協議鎖定 → 建構病例 → 盲化審閱 + schema 驗證 → 鎖檔 → OSF 預先註冊 → 才開始跑模型。預先註冊必須在第一次推論之前完成,否則「事後選一個好看的分析」這條路就打開了。

03抽掉一份治理文件,看多少致命風險裸露出來

七份文件對上十七個審查發現。移除文件 04,三個致命問題會同時亮紅。

04對抗審查:抓出四個會毀掉研究的問題

用 Codex(GPT-5.5)當敵意審查者,逐條攻擊治理設計。

審查結果:4 個致命(🔴)+ 11 個警告(🟡)+ 2 個風格(🔵)。四個致命問題全部在動工前被修掉:

🔴 1|IRB 的框架用錯了

問題

原本的敘述框架接近「規避 IRB」,這在審稿與倫理審查上都是致命的。

修正

改用「determination request(判定申請)」的正確語言 —— 主動請 IRB 判定本研究是否屬於人體研究,而不是自己宣稱不需要。

🔴 2|資料來源的授權條件不一致

問題

從公開文獻庫取得的個案報告,授權條件因來源而異,不能一體當成可自由使用。

修正

完全排除以個案報告為主要來源。

🔴 3|個案報告的知情同意不具傳遞性

問題

原作者取得的同意,不自動涵蓋我把它改寫成研究材料的用途。

修正

協議加上來源限制,溯源帳本加一欄標記「實質衍生」程度。

🔴 4|某個工具鏈接觸真實病人資料會違反法規

問題

原本規劃使用的一個外部工具,若接觸真實病人資料會違反個資法相關條文。

修正

該工具完全排除在流程之外。

11 個警告也全部對應到文件修改,包括:真實性評分的循環論證(改為盲化)、對抗式過擬合(改為預先註冊並鎖檔)、次領域樣本數不足(預先註冊聲明不做次領域宣稱)等。

05產線:治理文件也走同一套軌道

研究治理不是行政瑣事,它跟統計一樣需要被對抗檢查。

整包治理文件用同一套邏輯生產:先寫可否證的規則(不是原則宣示)、把規則寫成機器可檢查的形式(JSON Schema)、然後交給一個敵意審查者逐條攻擊,每一砲對應一份文件的修改。

「規則要可機器檢查」這一條很實際:病例格式用 JSON Schema 定義,驗證是跑腳本不是人眼掃;30 個病例是否都通過真實性門檻,是可以 grep 出來的事實,不是「我覺得都還可以」。

06現況與卡點

誠實說明它為什麼還沒有結果。

卡在關鍵路徑

IRB 回覆、審閱者契約簽署、OSF 預先註冊提交 —— 這些都是外部依賴,不是我一個人能推完的。

刻意不往前衝

在預先註冊完成之前跑任何模型推論,就會失去「主張是事前鎖定的」這個最重要的可信度來源。所以寧可停著。

07產出物

~/Desktop/local LLM VS Cloud LLM/paper-A-governance/
7 份治理文件 + Codex 審查對應表
…/04-vignette-construction-protocol.md
病例建構協議(v1 鎖定)
…/05-vignette-schema.yaml
機器可驗證的病例 Schema
…/07-OSF-preregistration-template.md
預先註冊內容
~/Desktop/local LLM VS Cloud LLM/INDEX.md
20 篇分級文獻庫索引(PDF + Markdown 雙格式)

醫學 AI 研究最貴的錯誤不在分析階段,在開工之前。把治理設計也放進對抗審查的軌道,等於在還沒花任何成本的時候就先付掉一次退稿。

← Foresight總覽SR/MA 產線 →

PROJECT 12 · 臨床推理研究治理包