← 回總覽 · 13 篇研究

評測科學主線 · 投稿候選

你早該用的那根誤差棒:對公開 benchmark 紀錄本身做統合分析

The Error Bar You Should Have Used: An Independence-Audited Meta-Analysis of the Published LLM Benchmark Record

SHIP-CANDIDATE SIEVE 評分 88 11 頁 含相依性敏感度分析

2026-07-12 完成 EXEC v1.1 · 10 個 benchmark · 154 個「至少兩個獨立來源」的模型×benchmark 格

PDF

原文:The Error Bar You Should Have Used(含相依性敏感度分析)

11 頁 · 186 KB · PDF

66 個 macro;第 11 頁是處理「同一報告者跨多格」的相依性分析。

開啟 →

前兩篇處理的是「一次測量的不確定性」。這篇往外一層:當一篇論文、一個排行榜、一則廠商公告說某模型考了幾分,讀者真正該在意的誤差棒是什麼?不是評測者自己能算的那根組內標準誤,而是不同報告者對同一格填出來的數字彼此差多少。所以這篇把公開紀錄本身當成待測量的量測系統。

01這篇在問什麼

把統合分析(meta-analysis)的方法轉向 AI 評測文獻本身。

醫學裡有成熟的做法:多個研究測同一件事,用統合分析估計「研究之間」的異質性。AI 評測沒有這一層——大家只看單一數字,或最多看單次評測的標準誤。

但真正的問題是:同一個「模型 × benchmark」的格子,如果有三個不同來源都報過分數,那三個數字差多少?這個 between-source(來源之間)再現性標準差 τ,才是讀者拿來判斷「這兩個模型真的有差嗎」的正確尺。

這裡有一個陷阱必須先處理:很多「獨立報告」其實是抄的。如果一份報告的數值跟廠商自己公布的完全一樣,它比較可能是傳播(propagation),不是獨立量測。把這些算進去會讓 τ 被系統性低估。所以在估計之前先跑一道獨立性審計

02同一格、不同來源:那根誤差棒到底該多長

每一叢點是同一個「模型 × benchmark」被不同人報出來的分數。開關獨立性審計,看那根誤差棒怎麼變。

03結論與關鍵數字

66 個 macro,全部由腳本注入。

6.1
來源之間再現性標準差 τ 的中位數(百分點)· \tauMedianPts
5.5×
τ 相對於單次評測理論誤差棒的中位倍率 · \ratioMedian
33.7%
可稽核格中被標記為「疑似傳播而非獨立量測」的比例 · \propShareA
97.9%
相鄰名次差距落在「兩份未來獨立報告」預測區間內含 0 的比例 · \flipShareAll
97.9% 的意思是:如果你隨機抽兩個相鄰名次的模型,再各找一個獨立來源重新報一次分數,兩者的差距有 97.9% 的機會可以反向。

資料規模:從 52 個原始 benchmark 篩到 10 個有足夠多來源可分析的,涵蓋 154 個至少有兩個不同報告來源的模型×benchmark 格。

產出物除了論文,還有一張折價表(discount table):每個 benchmark 上,一則公開分數差距要多大才構成證據。這是可以直接拿去用的東西。

04產線:把統計規格先鎖死,再碰資料

這篇的產線多了一層 —— 統計方法要先用模擬驗證,才准碰真實資料。

τ 的估計用的是 Paule–Mandel 共同 τ 估計量。但這個估計量在研究數 k 很小的時候行為不穩定——而評測文獻正好每一格只有 2 到 4 個來源。

所以流程是:先寫統計規格 → 先跑模擬確認小樣本行為 → 才准打開真實資料。規格鎖在 claim.lock 裡,改規格要留紀錄。

檔案作用
exec_workspace/STATS-SPEC.md統計方法規格書,動工前鎖定
exec_workspace/STATS-SPEC-2-dependence.md第二版規格:處理「同一報告者跨多格」的相依性
exec_workspace/claim.lock主張鎖檔,事後改動要走 addendum 留痕
exec_workspace/JOB_P.md / JOB_Q.md / JOB_V.md三份獨立派工單,各自產一份 joblog
exec_workspace/joblog_*.log每一次派工的完整輸出,事後可回溯
exec_workspace/data/SOURCE_ZIP_SHA256.txt原始資料壓縮檔的雜湊,證明分析用的是哪一版

資料雜湊那一條值得單獨講:資料集會更新,論文寫完半年後別人拿到的可能不是同一份。留一個 SHA256 就把「我用的是這一版」變成可驗證的事實,不是口頭承諾。

05審查關卡:三輪 fresh-context 統計覆核

統計方法越硬,越需要外部重推。

S2

題目快篩

六維評分(痛點 / 開放度 / 可驗證性 / 可行性 / 時效 / 期刊適配)

PASS-WITH-FLAG
G3.5

統計覆核 第一輪

`JOB_G35.md` → `joblog_G35.log`:全新 context 重推統計

SOUND
G3.5

統計覆核 第二輪

`JOB_G35_R2.md` → `joblog_G35R2.log`:針對第一輪的修正再審

SOUND
G3.5

統計覆核 第三輪

`joblog_G35R3.log` / `joblog_G35R31.log`:確認收斂

SOUND
相依性

第二版規格

`joblog_DEP.log`:交叉模擬 + 叢集 bootstrap 處理共同報告者

完成
JUDGE

最終評分

`JOB_JUDGE_FINAL.md`:全新 context 冷判

88 / ship-candidate

評分細項(滿分各不同):痛點 19、開放度 13、可驗證性 18、可行性 14、時效 15、期刊適配 9。時效滿分代表這題有先佔壓力——評審給的指示是「先佔優於再磨」。

06先驗證方法,再看資料

順序反過來就會不自覺地選一個對自己有利的估計量。

小樣本下的 Paule–Mandel 估計量會不會系統性低估或高估 τ?這個問題必須在看到真實答案之前回答,否則就會變成「哪個估計量給的數字比較好看就用哪個」。

相依性那一層也一樣:同一個報告者(例如某個常見的第三方評測站)會出現在很多格裡,格與格之間不獨立。第二版規格用交叉模擬加叢集 bootstrap 檢查這件事對結論的影響,結果寫成論文第 11 頁的敏感度分析。

07獨立性審計:對資料本身的對抗檢查

這篇最特別的一道機制是把「懷疑」寫成可執行的規則。

問題:怎麼分辨「獨立量測」和「抄廠商的數字」?

規則

預先註冊一條主要判準:若一則非廠商自報的數值與廠商自報值完全相同,標記為疑似傳播。

結果

在可稽核的格子裡,33.7% 的非自報觀測被標記。

影響

審計前 τ 中位數是 5.3、審計後是 6.1(\tauMedianNoAudit vs \tauMedianPts)。也就是不做這道審計,會低估文獻的真實離散度

重點在於這條規則是預先註冊的——先寫下判準,再套到資料上,而不是看完資料再決定哪些要剔除。後者會變成挑數據。

08誠實限制

審計規則是啟發式

「數值完全相同」只是傳播的一個指標,不是證明。有可能兩個獨立評測真的跑出同一個數字(尤其是題數少的 benchmark)。論文明說這是保守標記。

每格來源數很少

多數格子只有 2–3 個來源,τ 的估計本身就有相當大的不確定性。折價表要當成量級參考,不是精確門檻。

狀態:SIEVE 評分 88,屬 ship-candidate。投稿與否的簽核在我這裡,尚未送出。

09產出物

~/Desktop/research-pipeline/topics/0003-benchmark-record-meta-analysis/paper/main.pdf
11 頁論文
~/Desktop/ErrorBar-完整稿v2-11頁-含相依分析.pdf
桌面上的完整稿(含相依性敏感度分析)
…/exec_workspace/claim.lock
主張鎖檔
…/exec_workspace/joblog_*.log
10 份派工執行紀錄,可完整回溯
…/paper/generated/macros.tex
66 個數字 macro
…/exec_workspace/data/SOURCE_ZIP_SHA256.txt
原始資料雜湊

這篇是「不確定性堆疊」的第三層:SAVE 管單次測量之內,Half-Life 管一份考卷的壽命,這篇管的是整個公開文獻之間的離散度。

← Half-Life總覽Score Bridges →

PAPER 03 · The Error Bar You Should Have Used · topic 0003