SIEVE 一晚五篇 · D · 誠實負面
Judge Drift Auditing: Operating Characteristics of a Prediction-Powered e-Detector for LLM-Judge Drift under a Fixed Gold Budget
原文:Judge Drift Auditing
11 頁 · 183 KB · PDF
82 個 macro;中心發現是一個對自己不利的負面結果,寫在摘要裡。
開啟 →這篇有兩個負面消息:方法在我做完前四天被人先發表了,而且我量出來的結果顯示這個方法沒有比土法煉鋼好。兩件事都照實寫進論文,而不是換個角度把它包裝成勝利。
不是「能不能偵測」,是「值不值得」。
LLM-as-judge 撐起了現在的 RLHF、排行榜與產品評測。但 judge 本身是 API 背後的一個模型:靜默的版本更新或評分提示詞的修改,都會改變它的評分方式。從業者常說「我們的 judge 漂移了」。
一個合理的監測器應該結合便宜且大量的 judge 標註,加上稀少昂貴的人工黃金標準,而且要能承受連續監看而不誤報。
近期的同期工作(Li 等人 2026)已經提供了這樣一個監測器 —— prediction-powered e-process,有 anytime-valid 保證,並把它框成歸因問題(到底是系統變了還是 judge 變了)。
那篇論文自己說它沒有提供的東西是:操作特性。偵測延遲怎麼隨漂移幅度與黃金標註預算變化?跟從業者本來會用的變點偵測基準線比起來如何?這篇補的就是這一塊。
紅色區域是序貫偵測比固定樣本檢定還慢的地方。它比想像中大 —— 這就是本篇的負面結論。
82 個 macro。
偵測延遲可以用單一變數 ρΔ²(黃金標註比例 × 漂移幅度平方)很好地總結,R² = 0.97。但實測的對數對數斜率是 0.58(95% 信賴區間 0.51–0.66),次線性——也就是說增加黃金標註預算的邊際效益比理論預期低。
這個次線性正是它輸給固定樣本檢定的原因:序貫方法的優勢在於「可以早停」,但當偵測本身需要累積相當多的黃金標註時,早停的好處就被稀釋了。
與其餘四篇共用同一條軌道。
| 環節 | 工具 | 備註 |
|---|---|---|
| 選題 | SIEVE 題庫(38 題排名) | 從既有題庫挑 S2 已過的候選,不是臨時想的 |
| 規格 | SPEC.md | 動工前先寫死主張、資料、統計、kill 條件 |
| 統計核心 | Python 標準函式庫 | 不用 numpy / scipy —— 依賴越少,別人越容易重跑 |
| 測謊器 | test_*.py | 寫在方法本體之前 |
| 數字入稿 | scripts/make_macros.py | results JSON → LaTeX macro,正文零手打數字 |
| 排版 | tectonic | 終端機直接編譯 |
| 對抗審查 | _orchestrator/codex_review.sh | 叫 Codex(GPT-5.5)當敵意審稿人 |
| 獨立複驗 | _orchestrator/verify_paper.sh | orchestrator 重跑測試、重編 PDF、掃關鍵字與引用 |
gates/ 下 8 個檔案。
主張卡 + 拒稿信
新穎性
**這一關發現了被搶先**
資料
12 個資料檔 → 8500 筆保留、15 個受試主題、0 筆排除
統計測謊器
8 支測謊器全數通過(已獨立複驗)
分析
results JSON ×5
論文
11 頁
交付前
引用驗證 + 關鍵字掃描
G1 這一關的價值在這篇被完整展現:新穎性查證抓到一篇四天前上線的論文,跟我的方法本體高度重疊。如果沒有這一關,我會做完整篇才發現。
一個會誤報的監測器比沒有監測器更糟。
監測器的核心保證來自 Ville 不等式:在無限期監看下,誤報機率至多 α。所以第一支測謊器就是:跑 3000 條符合虛無假設的資料流,各 1500 步,數有幾條誤報。
結果 0.00%(名目 5%,理論上界 6.19%)。這代表方法是有效的 —— 問題不在有效性,在划不划算。
這是研究工作最常見也最少被誠實記錄的情況。
被搶先四天
G1 新穎性查證找到 arXiv 2606.15474,四天前上線,方法本體高度重疊。
換個角度重新包裝,宣稱自己的貢獻不同。(很常見,也很好做。)
把主張收窄到對方自己說他們沒做的那個角落:操作特性刻畫 —— 延遲律、操作特性曲線、黃金標註預算前緣、與 PELT 變點偵測基準線的比較。並在論文裡直接引用對方,說明分工。
然後量出來的結果對自己不利
在真實預算下,這個精巧的序貫方法輸給最簡單的固定樣本檢定。
報告這個負面結果,並把它寫成論文的中心發現之一,而不是挑一個序貫方法會贏的參數區間來當頭條。
WATCH / 誠實負面。評分 71,是五篇裡最低的。
方法不是我的
核心監測器是同期工作提出的。我的貢獻只是它的操作特性刻畫。這一點寫在摘要,不是藏在相關工作段。
結論不利於序貫方法
但這是在我測的預算範圍內。在黃金標註極貴、漂移極大的情境下結論可能反轉。
被搶先、而且量出來的結果對自己不利 —— 這篇兩樣都佔了,然後照實寫。研究產線的價值不在於它產出多少勝利,在於它產出的東西可不可信。
← Workflow Instability總覽Flagship Quarantine →
PAPER 08 · Judge Drift Auditing · SIEVE D