← 回總覽 · 13 篇研究

SIEVE 一晚五篇 · D · 誠實負面

當評分的 AI 自己變了:在固定人工標註預算下,偵測 judge 漂移到底划不划算

Judge Drift Auditing: Operating Characteristics of a Prediction-Powered e-Detector for LLM-Judge Drift under a Fixed Gold Budget

WATCH · 誠實負面 評分 71 11 頁 被搶先 4 天

2026-06-17 · 3000 條虛無資料流 × 1500 步 · 被 arXiv 2606.15474 搶先四天

PDF

原文:Judge Drift Auditing

11 頁 · 183 KB · PDF

82 個 macro;中心發現是一個對自己不利的負面結果,寫在摘要裡。

開啟 →

這篇有兩個負面消息:方法在我做完前四天被人先發表了,而且我量出來的結果顯示這個方法沒有比土法煉鋼好。兩件事都照實寫進論文,而不是換個角度把它包裝成勝利。

01這篇在問什麼

不是「能不能偵測」,是「值不值得」。

LLM-as-judge 撐起了現在的 RLHF、排行榜與產品評測。但 judge 本身是 API 背後的一個模型:靜默的版本更新或評分提示詞的修改,都會改變它的評分方式。從業者常說「我們的 judge 漂移了」。

一個合理的監測器應該結合便宜且大量的 judge 標註,加上稀少昂貴的人工黃金標準,而且要能承受連續監看而不誤報。

近期的同期工作(Li 等人 2026)已經提供了這樣一個監測器 —— prediction-powered e-process,有 anytime-valid 保證,並把它框成歸因問題(到底是系統變了還是 judge 變了)。

那篇論文自己說它沒有提供的東西是:操作特性。偵測延遲怎麼隨漂移幅度與黃金標註預算變化?跟從業者本來會用的變點偵測基準線比起來如何?這篇補的就是這一塊。

02偵測延遲曲面:序貫方法在哪些區域輸給土法煉鋼

紅色區域是序貫偵測比固定樣本檢定還慢的地方。它比想像中大 —— 這就是本篇的負面結論。

03結論:一個刻意不好看的發現

82 個 macro。

在真實預算下,prediction-powered 序貫偵測並沒有勝過簡單的固定樣本檢定
0.00%
3000 條虛無資料流的實測誤報率(名目 5%)· \NullFA
0.97
延遲對 ρΔ² 的解釋力 R² · \EddRtwo
105 vs 60
實測情境下 序貫偵測 vs 固定樣本 的偵測延遲 · \LiveGoldOnlyDelay / \LiveFixedNDelay

偵測延遲可以用單一變數 ρΔ²(黃金標註比例 × 漂移幅度平方)很好地總結,R² = 0.97。但實測的對數對數斜率是 0.58(95% 信賴區間 0.51–0.66),次線性——也就是說增加黃金標註預算的邊際效益比理論預期低。

這個次線性正是它輸給固定樣本檢定的原因:序貫方法的優勢在於「可以早停」,但當偵測本身需要累積相當多的黃金標註時,早停的好處就被稀釋了。

04產線

與其餘四篇共用同一條軌道。

環節工具備註
選題SIEVE 題庫(38 題排名)從既有題庫挑 S2 已過的候選,不是臨時想的
規格SPEC.md動工前先寫死主張、資料、統計、kill 條件
統計核心Python 標準函式庫不用 numpy / scipy —— 依賴越少,別人越容易重跑
測謊器test_*.py寫在方法本體之前
數字入稿scripts/make_macros.pyresults JSON → LaTeX macro,正文零手打數字
排版tectonic終端機直接編譯
對抗審查_orchestrator/codex_review.sh叫 Codex(GPT-5.5)當敵意審稿人
獨立複驗_orchestrator/verify_paper.shorchestrator 重跑測試、重編 PDF、掃關鍵字與引用

05關卡與交付物

gates/ 下 8 個檔案。

G0

主張卡 + 拒稿信

PASS
G1

新穎性

**這一關發現了被搶先**

PASS(發現 2606.15474)
G2

資料

12 個資料檔 → 8500 筆保留、15 個受試主題、0 筆排除

PASS
G3

統計測謊器

8 支測謊器全數通過(已獨立複驗)

PASS 8/8
G4

分析

results JSON ×5

PASS
G5

論文

11 頁

PASS
G6

交付前

引用驗證 + 關鍵字掃描

PASS

G1 這一關的價值在這篇被完整展現:新穎性查證抓到一篇四天前上線的論文,跟我的方法本體高度重疊。如果沒有這一關,我會做完整篇才發現。

06測謊器:誤報率必須先守住

一個會誤報的監測器比沒有監測器更糟。

監測器的核心保證來自 Ville 不等式:在無限期監看下,誤報機率至多 α。所以第一支測謊器就是:跑 3000 條符合虛無假設的資料流,各 1500 步,數有幾條誤報。

結果 0.00%(名目 5%,理論上界 6.19%)。這代表方法是有效的 —— 問題不在有效性,在划不划算。

07對抗審查:被搶先之後怎麼辦

這是研究工作最常見也最少被誠實記錄的情況。

被搶先四天

狀況

G1 新穎性查證找到 arXiv 2606.15474,四天前上線,方法本體高度重疊。

選項 A

換個角度重新包裝,宣稱自己的貢獻不同。(很常見,也很好做。)

選擇

把主張收窄到對方自己說他們沒做的那個角落:操作特性刻畫 —— 延遲律、操作特性曲線、黃金標註預算前緣、與 PELT 變點偵測基準線的比較。並在論文裡直接引用對方,說明分工。

然後量出來的結果對自己不利

發現

在真實預算下,這個精巧的序貫方法輸給最簡單的固定樣本檢定。

處理

報告這個負面結果,並把它寫成論文的中心發現之一,而不是挑一個序貫方法會贏的參數區間來當頭條。

自評

WATCH / 誠實負面。評分 71,是五篇裡最低的。

一篇誠實的 71 分,比一篇捏造的 92 分有用 —— 因為前者可以被別人拿去用,後者過不了審查。

08誠實限制

方法不是我的

核心監測器是同期工作提出的。我的貢獻只是它的操作特性刻畫。這一點寫在摘要,不是藏在相關工作段。

結論不利於序貫方法

但這是在我測的預算範圍內。在黃金標註極貴、漂移極大的情境下結論可能反轉。

09產出物

~/Desktop/sieve-papers/D-judge-drift/paper/main.pdf
11 頁論文
…/judge_drift/
prediction-powered e-detector 實作
…/results/
5 個 JSON,含虛無模擬與操作特性掃描
~/Desktop/sieve-papers/_orchestrator/codex_review_D-judge-drift.txt
Codex 敵意審查全文

被搶先、而且量出來的結果對自己不利 —— 這篇兩樣都佔了,然後照實寫。研究產線的價值不在於它產出多少勝利,在於它產出的東西可不可信。

← Workflow Instability總覽Flagship Quarantine →

PAPER 08 · Judge Drift Auditing · SIEVE D