← 回總覽 · 13 篇研究

誠實判死 · 附帶方法論收穫

凍結權重的模型能不能預測未來:正式判死,以及一個意外的副產品

Foresight Backtest: A Masked Evaluation of Frozen-Weight LLM Forecasting

KILL · 題目判死 v0 820 筆 + v1 1080 筆預測 harness 反手證明有效

2026-06-12 / 06-13 兩輪 · 120 題平衡題組(Manifold 2025 60 題 + Kalshi 2026 60 題)· 全本機推論

PDF

原文:Foresight Backtest 判決報告

10 頁 · 1244 KB · PDF

沒有 LaTeX 手稿。由判決解讀、原始統計報告與設計限制三份文件合併生成。

開啟 →

這個專案的價值全部在於它產生了一個乾淨的否定,以及一個沒預期到的副產品:同一套 harness 在判死主題目的同時,當場抓到了另一個模型的資料汙染指紋

01這個實驗在測什麼

一個很誘人、也很多人在做的想法。

如果一個模型的知識截止在 2024 年 6 月,那它對 2025、2026 才揭曉的事件,只能靠推理,不能靠記憶。這就構成一個乾淨的預測力測試 —— 所謂的「時光機」設計。

v0 跑了 820 筆預測後發現設計有缺陷(題組不平衡,猜「否」就能贏),所以 v1 全部重做:

02凍結模型全部貼著「擲骰子」那條線

切換年份看現代模型的汙染指紋 —— 它只在讀過的那一年表現好。

03判決:三條獨立證據鏈指向同一結論

不是「效果不明顯」,是「完全沒有鑑別力」。

證據一:全部輸給丟銅板,而且信賴區間不重疊

armBrier 分數(越低越好)95% 信賴區間vs 每題猜 50%(0.25)
scout 協議0.339[0.285, 0.397]
gpt-oss 120B 協議0.383[0.302, 0.466]
其餘全部 arm0.35–0.49全在 0.25 之上

證據二:AUC ≈ 0.50 —— 這才是死亡證明

armAUC 全體AUC 2025AUC 2026
scout(凍結)0.5140.5020.524
gpt-oss 120B(凍結)0.5160.5030.523
llama3.1(凍結)0.4690.5000.454
qwen3.6(現代,知道 2025)0.5640.6790.463
真錢市場 T-300.777

凍結模型的 AUC 全部貼著 0.50,等於擲骰子。校準術救不了「沒有 resolution(鑑別力)」的東西 —— 你可以把一個亂猜的預測調整得很校準,但它仍然一點資訊都沒有。

對照組:真錢預測市場在事件前 30 天的 AUC 是 0.777。這是這個任務真正可達到的水準。

04副產品:harness 當場抓到汙染指紋

這是這個專案真正的收穫。

同一張表裡藏著一個汙染的指紋

觀察

現代的 qwen3.6(知識涵蓋 2025)在 2025 題組的 AUC 是 0.679,但在 2026 題組只有 0.463(低於隨機)。

推論

如果它真的具備預測能力,兩個年份應該差不多。只在「它讀過的那一年」表現好 —— 這是記憶,不是預測

意義

這個對比就是資料汙染的指紋。而它是被同一套 harness 的分年份設計自動撈出來的,不是靠人事後發現。

主題目死了,但測試框架證明了自己有效 —— 它能分辨「真的會預測」和「只是讀過答案」。

05產線:怎麼讓一個否定結論值得相信

宣稱「某個方法沒用」比宣稱「有用」更需要嚴謹,因為很容易是自己沒做好。

正對照組那一條最關鍵。沒有它,「AUC 0.51」可以被解釋成「這些事件本來就無法預測」。有了真錢市場的 0.777,結論就變成明確的:可以預測,但模型做不到。

06誠實限制

只測了本機模型

沒有測閉源前沿模型。結論的適用範圍是「凍結權重的開源模型 + 純推理」。

提示詞空間沒有窮舉

有可能存在某種提示策略能拉起表現。但 AUC ≈ 0.50 的量級意味著要靠提示詞補上的差距非常大。

07產出物

~/Desktop/02-研究/foresight-backtest/FINDINGS.md
人讀的判決與解讀層
…/results/REPORT.md / REPORT_v1.md
v0 / v1 的原始統計報告
…/results/predictions*.jsonl
820 + 1080 筆原始預測全部留檔
…/README.md
設計與限制

一個乾淨的否定結論,加上一個能抓汙染的測試框架 —— 這比一篇「本方法有效」但沒人重現得出來的論文有用。

← ECG-Trust總覽臨床推理研究治理 →

PROJECT 11 · Foresight Backtest