誠實判死 · 附帶方法論收穫
Foresight Backtest: A Masked Evaluation of Frozen-Weight LLM Forecasting
原文:Foresight Backtest 判決報告
10 頁 · 1244 KB · PDF
沒有 LaTeX 手稿。由判決解讀、原始統計報告與設計限制三份文件合併生成。
開啟 →這個專案的價值全部在於它產生了一個乾淨的否定,以及一個沒預期到的副產品:同一套 harness 在判死主題目的同時,當場抓到了另一個模型的資料汙染指紋。
一個很誘人、也很多人在做的想法。
如果一個模型的知識截止在 2024 年 6 月,那它對 2025、2026 才揭曉的事件,只能靠推理,不能靠記憶。這就構成一個乾淨的預測力測試 —— 所謂的「時光機」設計。
v0 跑了 820 筆預測後發現設計有缺陷(題組不平衡,猜「否」就能贏),所以 v1 全部重做:
切換年份看現代模型的汙染指紋 —— 它只在讀過的那一年表現好。
不是「效果不明顯」,是「完全沒有鑑別力」。
| arm | Brier 分數(越低越好) | 95% 信賴區間 | vs 每題猜 50%(0.25) |
|---|---|---|---|
| scout 協議 | 0.339 | [0.285, 0.397] | 輸 |
| gpt-oss 120B 協議 | 0.383 | [0.302, 0.466] | 輸 |
| 其餘全部 arm | 0.35–0.49 | 全在 0.25 之上 | 輸 |
| arm | AUC 全體 | AUC 2025 | AUC 2026 |
|---|---|---|---|
| scout(凍結) | 0.514 | 0.502 | 0.524 |
| gpt-oss 120B(凍結) | 0.516 | 0.503 | 0.523 |
| llama3.1(凍結) | 0.469 | 0.500 | 0.454 |
| qwen3.6(現代,知道 2025) | 0.564 | 0.679 | 0.463 |
| 真錢市場 T-30 | 0.777 | — | — |
凍結模型的 AUC 全部貼著 0.50,等於擲骰子。校準術救不了「沒有 resolution(鑑別力)」的東西 —— 你可以把一個亂猜的預測調整得很校準,但它仍然一點資訊都沒有。
對照組:真錢預測市場在事件前 30 天的 AUC 是 0.777。這是這個任務真正可達到的水準。
這是這個專案真正的收穫。
同一張表裡藏著一個汙染的指紋
現代的 qwen3.6(知識涵蓋 2025)在 2025 題組的 AUC 是 0.679,但在 2026 題組只有 0.463(低於隨機)。
如果它真的具備預測能力,兩個年份應該差不多。只在「它讀過的那一年」表現好 —— 這是記憶,不是預測。
這個對比就是資料汙染的指紋。而它是被同一套 harness 的分年份設計自動撈出來的,不是靠人事後發現。
宣稱「某個方法沒用」比宣稱「有用」更需要嚴謹,因為很容易是自己沒做好。
results/predictions*.jsonl正對照組那一條最關鍵。沒有它,「AUC 0.51」可以被解釋成「這些事件本來就無法預測」。有了真錢市場的 0.777,結論就變成明確的:可以預測,但模型做不到。
只測了本機模型
沒有測閉源前沿模型。結論的適用範圍是「凍結權重的開源模型 + 純推理」。
提示詞空間沒有窮舉
有可能存在某種提示策略能拉起表現。但 AUC ≈ 0.50 的量級意味著要靠提示詞補上的差距非常大。
一個乾淨的否定結論,加上一個能抓汙染的測試框架 —— 這比一篇「本方法有效」但沒人重現得出來的論文有用。
PROJECT 11 · Foresight Backtest