中文

评估预测代理的战略推理

人工智能 2026-04-30 v1

摘要

预测基准产生准确率排行榜,但对某些预测者为何更准确几乎没有见解。我们引入 Bench to the Future 2 (BTF-2),包含 1,417 个过去预测问题,配有冻结的 1500 万文档研究语料库,其中代理可复现地进行研究和预测,产生完整的推理痕迹。BTF-2 可检测 0.004 Brier 评分的准确度差异,并可区分代理在研究与判断方面的差异。我们构建了一个比任何单个前沿代理都准确 0.011 Brier 的预测者,并用于在无事后偏见下评估代理的战略推理。我们发现,较好的预测者主要区别在于其对盲点进行事前分析并考虑黑天鹅事件。专人专事的人类预测者发现,前沿代理的主要战略推理失败在于评估政治和商业领导者的激励,判断他们是否会遵循已表态的计划,以及建模制度性过程。

关键词

引用

@article{arxiv.2604.26106,
  title  = {Evaluating Strategic Reasoning in Forecasting Agents},
  author = {Tom Liptay and Dan Schwarz and Rafael Poyiadzi and Jack Wildman and Nikos I. Bosse},
  journal= {arXiv preprint arXiv:2604.26106},
  year   = {2026}
}