← 回總覽 · 13 篇研究

SIEVE 一晚五篇 · B · 本批最佳

會抖的題目要隔離:給隨機性評測一個有統計保證的檢疫規則

Flaky-Task Quarantine: An Anytime-Valid, FDR-Controlled Isolation Rule for Legitimately-Stochastic Benchmark Items

SHIP · workshop 級 評分 85 · 本批最高 9 頁

2026-06-17 · 16 條可執行檢查 · 對照組:SAVE 89 分

PDF

原文:Flaky-Task Quarantine

9 頁 · 152 KB · PDF

81 個 macro;本批評分最高(85)。第 4 節明白標出定理與部署之間的那道縫。

開啟 →

這是那一晚五篇裡評分最高的(85),也是唯一被評為「真正跟 SAVE 同級」的。它處理的問題很具體:現代 AI benchmark 是合法地隨機的——重跑同一題可能從對變錯,而報告出來的幾個百分點進步常常就落在這個噪音範圍內。

01這篇在問什麼

從軟體工程借一個概念,然後補上它缺的東西。

軟體工程有「flaky test」這個概念:同一份確定性程式碼,測試時而過時而不過,處理方式是把它隔離(quarantine)起來別擋 CI。

AI 評測的情況更麻煩:題目本來就該是隨機的(模型會採樣),所以不能簡單說「會變動就是壞題」。真正的問題是:哪些題目抖得超過這份 benchmark 自身噪音水準能解釋的範圍?

方法:定義每題的「超額抖動」假設(翻轉率 ≤ 一個依難度調整的基準線),用下注型 e-process 檢定它(在任何累積的重跑次數都有效),再把每題的 e-value 餵進 stopped-e-BH 程序,得到一個在任何停止時刻偽發現率都受控的隔離集合。

02調重跑次數,看哪些題目真的抖

拉 K 從 2 到 24:K=2 什麼都抓不到,K=21 抓到一半以上。這就是偵測力曲線。

03結論與關鍵數字

81 個 macro。

0.0%
固定基準線下的實測 FDR(目標 q=0.1)· \ToneFDR
53.1%
K=21 次重跑時的偵測力 · \PowerKtwentyone
0.1%
實際部署的估計基準線下 FDR —— 保守,不是灌水 · \TsixaFDR

偵測力隨重跑預算上升:K=8 時 5.2%、K=11 時 25.5%、K=21 時 53.1%。這條曲線本身就是使用者要的資訊 —— 告訴你要重跑幾次才值得

論文自己標出來的那道縫

anytime-FDR 定理要求一個固定/外部的每題基準線;但實際部署的流程是從同一批翻轉資料估計基準線(留一法的同儕平均),這會讓各題的資料流互相耦合,踩出定理的範圍

所以論文把「已證明的」和「只有實測支持的」分開寫:固定基準線 → 有定理;估計基準線 → 只有模擬證據,實測 FDR 0.1%(保守,沒有膨脹)。

04產線

與其餘四篇共用同一條軌道。

環節工具備註
選題SIEVE 題庫(38 題排名)從既有題庫挑 S2 已過的候選,不是臨時想的
規格SPEC.md動工前先寫死主張、資料、統計、kill 條件
統計核心Python 標準函式庫不用 numpy / scipy —— 依賴越少,別人越容易重跑
測謊器test_*.py寫在方法本體之前
數字入稿scripts/make_macros.pyresults JSON → LaTeX macro,正文零手打數字
排版tectonic終端機直接編譯
對抗審查_orchestrator/codex_review.sh叫 Codex(GPT-5.5)當敵意審稿人
獨立複驗_orchestrator/verify_paper.shorchestrator 重跑測試、重編 PDF、掃關鍵字與引用

本篇多一項:gates/G2_fetch_log.txt —— 資料抓取的完整 log。資料從哪來、什麼時候抓的、抓了幾筆,全部留檔。

05關卡與交付物

gates/ 下 9 個檔案。

G0

主張卡 + 拒稿信

先寫一封拒死自己的信

PASS
G1

新穎性

獨立雙掃描器比對 flaky-test 文獻與評測統計文獻

PASS
G2

資料

`G2_data.md` + `G2_fetch_log.txt`

PASS
G3

統計測謊器

16 條可執行檢查,寫在方法之前

PASS · 抓到 3 個真 bug
G4

分析

results JSON ×3

PASS
G5

論文

9 頁

PASS
G6

交付前

引用驗證 + 關鍵字掃描

PASS

0616 條檢查,抓到 3 個真 bug

測謊器套件本身就是這篇的貢獻之一。

最後那一條是被對抗審查逼出來的,也正是它救了這篇 —— 見下。

07對抗審查:一次以「對作者有利」收場的爭議

Codex 提了一個看起來會毀掉這篇的問題。跑完之後,答案站在論文這邊。

★ 核心爭議:定理管的東西跟你做的東西不一樣

Codex 指出

anytime-FDR 定理要求固定或可預測的每題虛無參數 p₀,但流程是從同一批翻轉資料估計 p₀。定理只涵蓋玩具級的固定 p₀ 情境。

要求

明說定理只對固定/外部基準線成立,並補一支照實際部署方式估計基準線的虛無模擬,報告真實 FDR —— 可能會顯示膨脹,那就誠實收窄主張。

結果

跑完之後 FDR 是 0.1%,遠低於目標 0.1。留一法的同儕估計是保守的,不是膨脹。爭議以對作者有利的方式解決 —— 但這個結論只有在真的跑了才敢寫。

② 一句寫錯的技術描述

原句

「各題資料流之間沒有洩漏」

被抓

假的。留一法的同儕基準線本來就會耦合各題資料流。

修正

改成描述真實的過濾結構。這種錯誤不影響數字,但會讓懂的審稿人立刻不信任整篇。

★③ 一個站不住的主張被搬家

原本

「隔離之後排名會移動」,聽起來像是在真實資料上驗證了。

被抓

真實資料只有 K=2 次重跑,隔離數是 0。所謂的排名移動來自敘述性代理指標與半合成的 K=21,不是 FDR 規則在真實資料上跑出來的

修正

排名移動的主張改掛在半合成 K=21 上;真實 K=2 降級為「示範樣本數不足」。

08誠實限制

真實資料樣本數不足

K=2 次重跑抓不到任何東西。這篇的真實資料部分只證明了「重跑兩次不夠」。

定理與部署之間有縫

已證明的版本跟出貨的版本不完全是同一個。這道縫被寫在正文,不是藏在附錄。

評分 85,是那一晚五篇裡最高的,但仍然沒有乾淨地贏過 SAVE 的 89。這也照實寫在總結報告裡。

09產出物

~/Desktop/sieve-papers/B-flaky-quarantine/paper/main.pdf
9 頁論文
…/code/ + scripts/
統計核心與 16 條檢查
…/gates/G2_fetch_log.txt
資料抓取完整 log
~/Desktop/sieve-papers/_orchestrator/codex_review_B-flaky-quarantine.txt
Codex 敵意審查全文

這篇最好的地方不是分數,是它示範了一件事:當外部審查提出一個可能毀掉論文的質疑時,正確的反應是去跑它,而不是去辯它。

← Cost-Aware Racing總覽Workflow Instability →

PAPER 06 · Flaky-Task Quarantine · SIEVE B