← 回總覽 · 13 篇研究

SIEVE 一晚五篇 · A

按美金計價的模型比賽:把「省題數」換成「省錢」

Cost-Aware Anytime Racing: Paying for Language-Model Benchmark Decisions by the Dollar

SHIP · workshop 級 評分 83 11 頁

2026-06-17 · 31 組配對比較 · MMLU 1000 題 / GSM8K 300 題 · SAVE 的直系延伸

PDF

原文:Cost-Aware Anytime Racing

11 頁 · 151 KB · PDF

63 個 macro;含可預測選題政策的 anytime-valid 定理與兩支型一誤差模擬。

開啟 →

這是 SAVE 的直系延伸,也是整晚五篇裡最實用的一篇。既有的序貫評測方法都用「跑了幾題」當進度單位,但實務上你付的是 token 費。同一個模型內,單題輸出成本的變異係數可以到 1.54 —— 「中位題數」根本沒有在描述你實際付出的東西。

01這篇在問什麼

題數不等於錢。

序貫評測的賣點是「早點停、少跑幾題」。但一題要求逐步推理的題目,輸出 token 可能是一題單選題的數十倍。用題數當進度單位,等於假設所有題目一樣貴。

實測:在 MMLU 上,同一個模型內部單題輸出成本的變異係數最高到 1.54(中位 1.26);GSM8K 因為題型一致,只有 0.39–0.48。也就是說 MMLU 這種混合題型的 benchmark,「省了 33% 的題數」跟「省了 33% 的錢」完全是兩回事。

方法叫 CARA(Cost-Aware Anytime Racing):配對的下注型信賴序列,但下一題要評哪一個,由一個可預測(predictable)的成本感知規則決定,並且用總成本當停止條件。

02成本賽道:同樣的錢,哪種選題規則走得更遠

換選題政策看軌跡怎麼變。oracle 那條標成虛線,因為它偷看了答案、拿不到保證。

03結論與關鍵數字

63 個 macro。

52.0%
可部署規則的 token 成本中位節省 · \SavMedOverall
1.54
單模型內單題成本變異係數上限 · \CVMMLUMax
0.036 / 0.026
線上監測 / 配對程序的實測型一誤差(名目 0.05)· \TypeIOnline / \TypeIRunPaired

31 組比較中 25 組節省為正,6 組為負(在很快就分出勝負的配對上,成本感知繞路反而多花);77% 的配對節省超過 20%。

本篇的定理

配對 e-process 在任何可預測的選擇政策下都保持 anytime-valid,只要每一個可容許的下一次抽樣,其條件平均都服從虛無假設。換句話說:用成本規則分配預算,不需要付出任何型一誤差的代價

這個假設明確排除兩類規則:偷看下一題結果的預期型規則、以及可能過度抽取某個超虛無群體的分層規則。這一句是被對抗審查逼出來的(見下)。

04產線:五篇共用的同一條軌道

這五篇是同一晚跑出來的,用同一套關卡與同一套審查。

SIEVE 是我建的題目篩選與論文生產管線。五篇論文各自獨立跑一次 G0–G6,但共用同一套規則:統計核心只准用 Python 標準函式庫、測謊器寫在方法之前、數字只能來自腳本、以及交付前的雙重審查(Codex 敵意審查 + orchestrator 獨立複驗)。

環節工具備註
選題SIEVE 題庫(38 題排名)從既有題庫挑 S2 已過的候選,不是臨時想的
規格SPEC.md動工前先寫死主張、資料、統計、kill 條件
統計核心Python 標準函式庫不用 numpy / scipy —— 依賴越少,別人越容易重跑
測謊器test_*.py寫在方法本體之前
數字入稿scripts/make_macros.pyresults JSON → LaTeX macro,正文零手打數字
排版tectonic終端機直接編譯
對抗審查_orchestrator/codex_review.sh叫 Codex(GPT-5.5)當敵意審稿人
獨立複驗_orchestrator/verify_paper.shorchestrator 重跑測試、重編 PDF、掃關鍵字與引用

「只用標準函式庫」這條看起來像自虐,其實是可信度設計:沒有 numpy / scipy 依賴,任何人拿到程式碼都能在乾淨的 Python 直接跑,不會因為套件版本不同而重現不出來。

05關卡與交付物

gates/ 下 8 個檔案。

G0

主張卡 + 拒稿信

`gates/G0_claim_card.md`、`G0_rejection_letter.md`

PASS
G1

新穎性

`gates/G1_novelty.md` + 獨立雙掃描器前人工作比對

PASS
G2

資料

`gates/G2_data.md`:真實逐題 token 成本 log

PASS
G3

統計測謊器

`gates/G3_stats.md` + `cara/test_validity.py`

PASS
G4

分析

`gates/G4_analysis.md` + results JSON ×3

PASS
G5

論文

`gates/G5_paper.md`:tectonic 產 11 頁

PASS
G6

交付前

`gates/G6_final.md`:引用驗證 + 關鍵字掃描

PASS

06測謊器:兩種型一誤差都要單獨測

宣稱一個統計保證,就得有一支會 FAIL 的測試在守它。

為什麼要分兩支測?因為理論證的是單邊比賽在 log(1/α) 門檻,但實際出貨的程序用的是雙邊 log(2/α) 與 α/2。理論證的東西跟出貨的東西不是同一個 —— 這一條也是對抗審查抓出來的。

07對抗審查:Codex 抓到的真問題

五篇論文全部拿到 VERDICT=flawed。第一輪就過的審查,通常是審查沒在審。

① 頭條數字用了一個定理管不到的規則

原本

頭條節省率用的是「依照已實現的效果量/成本比」來排序題目 —— 節省 84.5%,數字很漂亮。

被抓

這是預期型(anticipatory)規則:它偷看了下一題的結果。定理只涵蓋可預測規則,所以這個 84.5% 拿不到 anytime-valid 的保證。

修正

頭條換成真正可部署的可預測規則(只用已知成本、絕不看下一題的標籤),節省率從 84.5% 降到 52.0%;84.5% 改標示為「理論上界包絡,明確標註不可達成」。

代價

頭條數字直接掉 32 個百分點。這是誠實收斂的實際成本。

② 兩種不同的保證被綁在一起講

被抓

「優勢或平手」被包在同一個型一誤差保證下敘述,但這兩者的保證型別不同(優勢是族系錯誤率,平手是信賴序列覆蓋率)。

修正

拆開分別陳述。

另外還有兩條:定理原本寫「任何自適應規則」屬於過度宣稱,收斂成「可預測且條件平均服從虛無的規則」;以及基準線也用了已實現效果量,改成可預測對可預測的公平比較。

淨效果:頭條變小了。這正是對抗審查該有的樣子 —— 它讓論文變弱,但讓論文變真。

08誠實限制

有 6 組是賠錢的

在很快就分出勝負的配對上,成本感知的繞路反而讓總成本上升。論文列出這 6 組,不只報中位數。

84.5% 是拿不到的

理論上界被明白標為不可達成。任何引用這篇時說「可省 84%」都是誤讀。

09產出物

~/Desktop/sieve-papers/A-cost-racing/paper/main.pdf
11 頁論文
…/cara/core.py + test_validity.py
統計核心與測謊器(純標準函式庫)
…/gates/
G0–G6 共 8 個關卡檔
~/Desktop/sieve-papers/_orchestrator/codex_review_A-cost-racing.txt
Codex 敵意審查全文

這篇的價值不只在方法,也在於它示範了對抗審查會讓論文的頭條數字縮水三成 —— 而我選擇讓它縮水。

← Score Bridges總覽Flaky Quarantine →

PAPER 05 · Cost-Aware Anytime Racing · SIEVE A