预测竞技场:在真实预测市场上评估 AI 模型的基准
摘要
我们引入预测竞技场,一个用于评估 AI 模型预测准确率和决策能力的基准,通过使其在真实预测市场上进行自主交易来实现。与合成基准不同,预测竞技场在实际交易所(Kalshi 和 Polymarket)上的交易中测试模型,提供客观的真实结果,无法被操控或过拟合。每个模型作为独立的代理人,拥有 10,000 美元初始资金,每 15-45 分钟做出自主决策。在 57 天的纵向评估期间(2026年1月12日至3月9日),我们跟踪两个队列:6 个前沿模型进行实时交易(队列1,整个周期)和4 个下一代模型进行纸质交易(队列2,3天预备期)。对于队列1,Kalshi 的最终收益范围为 -16.0%至 -30.8%。我们的分析识别出明确的性能层级:初始预测准确率和正确预测后获利的能力是主要驱动因素,而研究量与结果无关。从平行的 Polymarket 实时交易中出现的 striking 的跨平台差异表明:队列1模型在 Polymarket 上平均仅为 -1.1%,而在 Kalshi 上为 -22.6%,其中 grok-4-20-checkpoint 实现了 71.4% 的结算胜率——在任何平台或队列中都最高。gemini-3.1-pro-preview(队列2),在 Kalshi 上未执行任何交易,却在 Polymarket 上 3 天内实现 +6.02% 的收益——在两个队列中最佳收益,表明平台设计对哪些模型成功有着深远的影响。除了性能外,我们分析了计算效率(token 使用量、循环时间)、结算准确率、退出模式和市场偏好,为前沿模型在真实金融压力下的行为提供了全面视角。
引用
@article{arxiv.2604.07355,
title = {Prediction Arena: Benchmarking AI Models on Real-World Prediction Markets},
author = {Jaden Zhang and Gardenia Liu and Oliver Johansson and Hileamlak Yitayew and Kamryn Ohly and Grace Li},
journal= {arXiv preprint arXiv:2604.07355},
year = {2026}
}
备注
18 pages, 10 figures, 3 tables. Evaluation period: January 12 - March 9, 2026