評測科學主線 · 投稿候選
The Error Bar You Should Have Used: An Independence-Audited Meta-Analysis of the Published LLM Benchmark Record
原文:The Error Bar You Should Have Used(含相依性敏感度分析)
11 頁 · 186 KB · PDF
66 個 macro;第 11 頁是處理「同一報告者跨多格」的相依性分析。
開啟 →前兩篇處理的是「一次測量的不確定性」。這篇往外一層:當一篇論文、一個排行榜、一則廠商公告說某模型考了幾分,讀者真正該在意的誤差棒是什麼?不是評測者自己能算的那根組內標準誤,而是不同報告者對同一格填出來的數字彼此差多少。所以這篇把公開紀錄本身當成待測量的量測系統。
把統合分析(meta-analysis)的方法轉向 AI 評測文獻本身。
醫學裡有成熟的做法:多個研究測同一件事,用統合分析估計「研究之間」的異質性。AI 評測沒有這一層——大家只看單一數字,或最多看單次評測的標準誤。
但真正的問題是:同一個「模型 × benchmark」的格子,如果有三個不同來源都報過分數,那三個數字差多少?這個 between-source(來源之間)再現性標準差 τ,才是讀者拿來判斷「這兩個模型真的有差嗎」的正確尺。
這裡有一個陷阱必須先處理:很多「獨立報告」其實是抄的。如果一份報告的數值跟廠商自己公布的完全一樣,它比較可能是傳播(propagation),不是獨立量測。把這些算進去會讓 τ 被系統性低估。所以在估計之前先跑一道獨立性審計。
每一叢點是同一個「模型 × benchmark」被不同人報出來的分數。開關獨立性審計,看那根誤差棒怎麼變。
66 個 macro,全部由腳本注入。
資料規模:從 52 個原始 benchmark 篩到 10 個有足夠多來源可分析的,涵蓋 154 個至少有兩個不同報告來源的模型×benchmark 格。
產出物除了論文,還有一張折價表(discount table):每個 benchmark 上,一則公開分數差距要多大才構成證據。這是可以直接拿去用的東西。
這篇的產線多了一層 —— 統計方法要先用模擬驗證,才准碰真實資料。
τ 的估計用的是 Paule–Mandel 共同 τ 估計量。但這個估計量在研究數 k 很小的時候行為不穩定——而評測文獻正好每一格只有 2 到 4 個來源。
所以流程是:先寫統計規格 → 先跑模擬確認小樣本行為 → 才准打開真實資料。規格鎖在 claim.lock 裡,改規格要留紀錄。
| 檔案 | 作用 |
|---|---|
exec_workspace/STATS-SPEC.md | 統計方法規格書,動工前鎖定 |
exec_workspace/STATS-SPEC-2-dependence.md | 第二版規格:處理「同一報告者跨多格」的相依性 |
exec_workspace/claim.lock | 主張鎖檔,事後改動要走 addendum 留痕 |
exec_workspace/JOB_P.md / JOB_Q.md / JOB_V.md | 三份獨立派工單,各自產一份 joblog |
exec_workspace/joblog_*.log | 每一次派工的完整輸出,事後可回溯 |
exec_workspace/data/SOURCE_ZIP_SHA256.txt | 原始資料壓縮檔的雜湊,證明分析用的是哪一版 |
資料雜湊那一條值得單獨講:資料集會更新,論文寫完半年後別人拿到的可能不是同一份。留一個 SHA256 就把「我用的是這一版」變成可驗證的事實,不是口頭承諾。
統計方法越硬,越需要外部重推。
題目快篩
六維評分(痛點 / 開放度 / 可驗證性 / 可行性 / 時效 / 期刊適配)
統計覆核 第一輪
`JOB_G35.md` → `joblog_G35.log`:全新 context 重推統計
統計覆核 第二輪
`JOB_G35_R2.md` → `joblog_G35R2.log`:針對第一輪的修正再審
統計覆核 第三輪
`joblog_G35R3.log` / `joblog_G35R31.log`:確認收斂
第二版規格
`joblog_DEP.log`:交叉模擬 + 叢集 bootstrap 處理共同報告者
最終評分
`JOB_JUDGE_FINAL.md`:全新 context 冷判
評分細項(滿分各不同):痛點 19、開放度 13、可驗證性 18、可行性 14、時效 15、期刊適配 9。時效滿分代表這題有先佔壓力——評審給的指示是「先佔優於再磨」。
順序反過來就會不自覺地選一個對自己有利的估計量。
小樣本下的 Paule–Mandel 估計量會不會系統性低估或高估 τ?這個問題必須在看到真實答案之前回答,否則就會變成「哪個估計量給的數字比較好看就用哪個」。
相依性那一層也一樣:同一個報告者(例如某個常見的第三方評測站)會出現在很多格裡,格與格之間不獨立。第二版規格用交叉模擬加叢集 bootstrap 檢查這件事對結論的影響,結果寫成論文第 11 頁的敏感度分析。
這篇最特別的一道機制是把「懷疑」寫成可執行的規則。
問題:怎麼分辨「獨立量測」和「抄廠商的數字」?
預先註冊一條主要判準:若一則非廠商自報的數值與廠商自報值完全相同,標記為疑似傳播。
在可稽核的格子裡,33.7% 的非自報觀測被標記。
審計前 τ 中位數是 5.3、審計後是 6.1(\tauMedianNoAudit vs \tauMedianPts)。也就是不做這道審計,會低估文獻的真實離散度。
重點在於這條規則是預先註冊的——先寫下判準,再套到資料上,而不是看完資料再決定哪些要剔除。後者會變成挑數據。
審計規則是啟發式
「數值完全相同」只是傳播的一個指標,不是證明。有可能兩個獨立評測真的跑出同一個數字(尤其是題數少的 benchmark)。論文明說這是保守標記。
每格來源數很少
多數格子只有 2–3 個來源,τ 的估計本身就有相當大的不確定性。折價表要當成量級參考,不是精確門檻。
狀態:SIEVE 評分 88,屬 ship-candidate。投稿與否的簽核在我這裡,尚未送出。
這篇是「不確定性堆疊」的第三層:SAVE 管單次測量之內,Half-Life 管一份考卷的壽命,這篇管的是整個公開文獻之間的離散度。
PAPER 03 · The Error Bar You Should Have Used · topic 0003