中文

从实验室到未来:面向预测智能体的过去预测基准

计算与语言 2025-06-30 v1 人工智能 机器学习

摘要

预测是一种具有明确衡量标准的任务,可用于研究 AI 系统。预测需要大量的网络研究,且评估需要事件发生的时间,使得开发预测基准具有挑战性。迄今为止,尚无预测基准能提供真实、封闭且可重复的环境供 LLM 预测者使用。我们引入 Bench To the Future(BTF),这是一个具有数百个高质�问题的“过去预测”基准,问题的解决结果已知。每个问题都伴随大规模离线语料库,包含数万篇相关网页,能够从 LLM 中以类似基于互联网预测的风险方式“预测”过去事件。结果表明,我们的过去预测环境能够产生与基于互联网预测(针对当时未解决的查询)相当的结果。我们展示了使用几种 LLM 对 agent 和 chain-of-thought 预测方法进行基准测试的结果,包括最近发布的 Claude 4 模型,表明 BTF 能够追踪预测能力在随时间推移中的 steady 进展。我们意图将其作为一个活跃的基准,持续添加新问题以account for increasing 训练数据截止日期。我们邀请研究人员通过 [email protected] 与我们联系,以利用我们的基准或工具进行各自的研究。

关键词

引用

@article{arxiv.2506.21558,
  title  = {Bench to the Future: A Pastcasting Benchmark for Forecasting Agents},
  author = {FutureSearch and : and Jack Wildman and Nikos I. Bosse and Daniel Hnyk and Peter Mühlbacher and Finn Hambly and Jon Evans and Dan Schwarz and Lawrence Phillips},
  journal= {arXiv preprint arXiv:2506.21558},
  year   = {2025}
}