SIEVE 一晚五篇 · B · 本批最佳
Flaky-Task Quarantine: An Anytime-Valid, FDR-Controlled Isolation Rule for Legitimately-Stochastic Benchmark Items
原文:Flaky-Task Quarantine
9 頁 · 152 KB · PDF
81 個 macro;本批評分最高(85)。第 4 節明白標出定理與部署之間的那道縫。
開啟 →這是那一晚五篇裡評分最高的(85),也是唯一被評為「真正跟 SAVE 同級」的。它處理的問題很具體:現代 AI benchmark 是合法地隨機的——重跑同一題可能從對變錯,而報告出來的幾個百分點進步常常就落在這個噪音範圍內。
從軟體工程借一個概念,然後補上它缺的東西。
軟體工程有「flaky test」這個概念:同一份確定性程式碼,測試時而過時而不過,處理方式是把它隔離(quarantine)起來別擋 CI。
AI 評測的情況更麻煩:題目本來就該是隨機的(模型會採樣),所以不能簡單說「會變動就是壞題」。真正的問題是:哪些題目抖得超過這份 benchmark 自身噪音水準能解釋的範圍?
方法:定義每題的「超額抖動」假設(翻轉率 ≤ 一個依難度調整的基準線),用下注型 e-process 檢定它(在任何累積的重跑次數都有效),再把每題的 e-value 餵進 stopped-e-BH 程序,得到一個在任何停止時刻偽發現率都受控的隔離集合。
拉 K 從 2 到 24:K=2 什麼都抓不到,K=21 抓到一半以上。這就是偵測力曲線。
81 個 macro。
偵測力隨重跑預算上升:K=8 時 5.2%、K=11 時 25.5%、K=21 時 53.1%。這條曲線本身就是使用者要的資訊 —— 告訴你要重跑幾次才值得。
anytime-FDR 定理要求一個固定/外部的每題基準線;但實際部署的流程是從同一批翻轉資料估計基準線(留一法的同儕平均),這會讓各題的資料流互相耦合,踩出定理的範圍。
所以論文把「已證明的」和「只有實測支持的」分開寫:固定基準線 → 有定理;估計基準線 → 只有模擬證據,實測 FDR 0.1%(保守,沒有膨脹)。
與其餘四篇共用同一條軌道。
| 環節 | 工具 | 備註 |
|---|---|---|
| 選題 | SIEVE 題庫(38 題排名) | 從既有題庫挑 S2 已過的候選,不是臨時想的 |
| 規格 | SPEC.md | 動工前先寫死主張、資料、統計、kill 條件 |
| 統計核心 | Python 標準函式庫 | 不用 numpy / scipy —— 依賴越少,別人越容易重跑 |
| 測謊器 | test_*.py | 寫在方法本體之前 |
| 數字入稿 | scripts/make_macros.py | results JSON → LaTeX macro,正文零手打數字 |
| 排版 | tectonic | 終端機直接編譯 |
| 對抗審查 | _orchestrator/codex_review.sh | 叫 Codex(GPT-5.5)當敵意審稿人 |
| 獨立複驗 | _orchestrator/verify_paper.sh | orchestrator 重跑測試、重編 PDF、掃關鍵字與引用 |
本篇多一項:gates/G2_fetch_log.txt —— 資料抓取的完整 log。資料從哪來、什麼時候抓的、抓了幾筆,全部留檔。
gates/ 下 9 個檔案。
主張卡 + 拒稿信
先寫一封拒死自己的信
新穎性
獨立雙掃描器比對 flaky-test 文獻與評測統計文獻
資料
`G2_data.md` + `G2_fetch_log.txt`
統計測謊器
16 條可執行檢查,寫在方法之前
分析
results JSON ×3
論文
9 頁
交付前
引用驗證 + 關鍵字掃描
測謊器套件本身就是這篇的貢獻之一。
最後那一條是被對抗審查逼出來的,也正是它救了這篇 —— 見下。
Codex 提了一個看起來會毀掉這篇的問題。跑完之後,答案站在論文這邊。
★ 核心爭議:定理管的東西跟你做的東西不一樣
anytime-FDR 定理要求固定或可預測的每題虛無參數 p₀,但流程是從同一批翻轉資料估計 p₀。定理只涵蓋玩具級的固定 p₀ 情境。
明說定理只對固定/外部基準線成立,並補一支照實際部署方式估計基準線的虛無模擬,報告真實 FDR —— 可能會顯示膨脹,那就誠實收窄主張。
跑完之後 FDR 是 0.1%,遠低於目標 0.1。留一法的同儕估計是保守的,不是膨脹。爭議以對作者有利的方式解決 —— 但這個結論只有在真的跑了才敢寫。
② 一句寫錯的技術描述
「各題資料流之間沒有洩漏」
假的。留一法的同儕基準線本來就會耦合各題資料流。
改成描述真實的過濾結構。這種錯誤不影響數字,但會讓懂的審稿人立刻不信任整篇。
★③ 一個站不住的主張被搬家
「隔離之後排名會移動」,聽起來像是在真實資料上驗證了。
真實資料只有 K=2 次重跑,隔離數是 0。所謂的排名移動來自敘述性代理指標與半合成的 K=21,不是 FDR 規則在真實資料上跑出來的。
排名移動的主張改掛在半合成 K=21 上;真實 K=2 降級為「示範樣本數不足」。
真實資料樣本數不足
K=2 次重跑抓不到任何東西。這篇的真實資料部分只證明了「重跑兩次不夠」。
定理與部署之間有縫
已證明的版本跟出貨的版本不完全是同一個。這道縫被寫在正文,不是藏在附錄。
評分 85,是那一晚五篇裡最高的,但仍然沒有乾淨地贏過 SAVE 的 89。這也照實寫在總結報告裡。
這篇最好的地方不是分數,是它示範了一件事:當外部審查提出一個可能毀掉論文的質疑時,正確的反應是去跑它,而不是去辯它。
← Cost-Aware Racing總覽Workflow Instability →
PAPER 06 · Flaky-Task Quarantine · SIEVE B