評測科學主線 · GO
Score Bridges: Auditing LLM Benchmark Version Migrations with Test Equating
原文:Score Bridges(v7 · S5 模擬審稿會通過版)
19 頁 · 197 KB · PDF
145 個 macro,本系列最多;含五條定理與七種敏感度分析。
開啟 →教育測驗有一整套處理「換考卷之後分數怎麼比」的理論,叫 test equating(測驗等化)。LLM benchmark 換版時面對的是同一個問題,但沒有人用這套工具。這篇把模型當成等化理論裡的「共同受試者」,在 MMLU 到 MMLU-Pro 的真實遷移上做了一次稽核。
換版之後,舊分數還能不能放在新分數旁邊?
benchmark 會被替換、修補、重新計分。實務上一個舊版的分數常常就直接被放在新版分數旁邊比較,彷彿兩者共用同一把尺。這篇問:這樣做的代價有多大?
作法是把它當成分數連結(score linking)問題:模型扮演等化理論裡的共同受試者,用 leave-one-model-out 共同受試者橋接 把舊版分數轉換到新版尺度上,再看有多少「原本看起來已經定案」的比較會翻盤。
第一版的說法是「40.5% 的結論是錯的」。這個說法被自己證的定理否掉了。特徵化定理說明:翻轉率量的是兩個尺度在實際比較發生的位置上相隔多遠,也就是尺度位移(scale displacement),不是錯誤結論的比率。
證據是:在同一個版本內,模型排序高度一致(Kendall τ ≥ 0.84,跨所有稽核面板)。所以危險的是跨版本比較這個動作本身,不是模型品質排序被打亂。
下層是舊版尺度、上層是新版。切換等化橋,看哪些配對的相對順序翻轉。
145 個 macro——本系列最多的一篇。
主稽核:21 個模型、3,931 題的版本鎖定面板。另外兩個獨立稽核不與主結果合併,只作為佐證:
敏感度分析做滿七種:家族感知、題目重抽、留一家族、加回、分類、橋接方法選擇、以及以誤差尺度校準的平手帶。結論在七種下都活著。
這篇跟前三篇最大的不同 —— 它有數學定理,而定理沒辦法用模擬「證明」,只能用模擬「反證」。
五條定理各有一份獨立的證明檔與重推紀錄。作法是:證明寫完之後,由全新 context 從定理陳述重新推導一次,兩份推導不一致就代表有問題。
| 檔案 | 內容 |
|---|---|
gates/THEOREM-TA-PROOF-2026-07-11.md | 定理 A 完整證明 |
gates/THEOREM-TB-PROOF-2026-07-11.md | 定理 B 完整證明 |
gates/G3_5_TA_rederivation_R1.md | 全新 context 對定理 A 的獨立重推 |
gates/G3_5_TB_rederivation_R1.md | 全新 context 對定理 B 的獨立重推 |
gates/M15_theorem_addition_2026-07-11.md | 第五條定理的加入紀錄(進 claim.lock) |
claim.lock | 五條定理 + 主張的鎖檔 |
定理 T4 給的是有限樣本的 sup-norm 界,並且附一個「活化門檻」:在 21 個模型時拿不到 95% 的證書,原始尺度要到 36 個模型才第一次活化。這個門檻被明白標在論文裡(範圍標籤 39/40/71/75),因為一條在你的樣本數下根本用不到的定理,寫進論文就是誤導。
定理 T5 處理的是前面那個關鍵區分:翻轉率到底在量什麼。它給出翻轉率的識別式,並且在真實資料上精確重現了 375 組中的 152 組 —— 精確重現的意思是理論預測值與實際數完全相同,不是近似。
這篇跑了整個系列裡最長的審查鏈。
S3 收據
`gates/G1_s3_receipts.md`:新穎性與前人工作證據
資料盤點
`gates/G2_data_inventory.csv` + `G2b_substrate_fit.json`:資料底材適配度檢查
統計覆核 第一輪
`gates/g3_5/REVIEW_ROUND1.md`
修復後再審
`REVIEW_ROUND2.md` / `REVIEW_ROUND3.md`
全鏈重跑確認
`REVIEW_FULLSUITE_2026-07-11.md` + `..._CONFIRM_...md`
模擬審稿會 R1
三個角色各自獨立審:`S5_R1_AREACHAIR.md`、`S5_R1_REVIEWER2.md`、`S5_R1_STATISTICIAN.md`
回應矩陣 + R2
`S5_R1_RESPONSE_MATRIX.md` 逐條回應 → R2 三角色再審
最終裁決
`S5_VERDICT.md`
第一輪統計覆核給的是 FLAWED。這在系列裡不是特例——五篇 SIEVE 論文的對抗審查也是全部 FLAWED。第一輪就過的審查,通常代表審查沒在審。
S5 這一關特別值得說:它模擬一場真實的審稿會,領域主席、二號審稿人、統計審稿人各自用獨立 context 出意見,然後我要寫一份逐條回應矩陣,再送第二輪。這是把「投稿後才會收到的攻擊」提前到還來得及改的時候。
定理宣稱的信賴水準,要在模擬裡真的達到。
定理說某個區間有 95% 覆蓋率,那就在模擬裡跑一千次看是不是真的蓋到 95%。這一輪跑了 4 個設定各 1000 次,全部達標(1000/1000 覆蓋)。
另外有一份勘誤檔 gates/ERRATUM-run5-interpretation-2026-07-16.md —— 第五次執行的結果解讀有誤,發現之後另開一個檔案記錄,而不是默默改掉。這是刻意的:修正紀錄本身就是可信度的一部分。
第二個遷移還沒做完
GSM8K → GSM-Plus 前導只有 19 個模型,區間跨過預先註冊的門檻。論文明白標示這不構成第二個獨立證據。
定理有活化門檻
T4 的有限樣本界在 21 個模型時給不出 95% 證書。這個限制寫在正文,不是藏在附錄。
評分 73.3 屬 GO(比 SAVE 的 89、Error Bar 的 88 低)。低的原因主要在開放度與期刊適配,不在方法本身。目標場次 ICLR 2027。
這篇補完了不確定性堆疊的第四層:版本之間。四篇合起來是一句可以對外講的研究身分——我做 AI 測量的不確定性,從單次實驗一路到整個文獻。
← Error Bar總覽Cost-Aware Racing →
PAPER 04 · Score Bridges · topic 0004