LEAF:用于事件增强预测的活跃基准
机器学习
2026-05-19 v1 人工智能
摘要
大型语言模型(LLM)越来越多地被用于预测任务。为评估此能力并缓解预训练数据污染,已提出数个活跃基准。然而,现有基准要么缺乏数据稀缺导致的多维事件以满足准确预测,要么聚焦于相对封闭的环境。为评估LLM在复杂现实场景中的预测能力,我们提出LEAF,即首个用于事件增强预测任务的活跃基准,包括未来事件概率、趋势和时间序列预测。LEAF利用递归检索代理系统搭配双代理交叉验证,为预测提供全面且相关的辅助文本。评估最先进的专有和开源LLM,发现这些模型能够利用从复杂事件中提取的信号来提升预测性能。在股票领域,我们发现LLM在其自信预测的股票上表现更好。此外,事件与目标股票之间存在强相关性。为此,LEAF为持续跟踪和推动事件驱动预测任务的进展提供了必要的、动态更新的测试平台。
引用
@article{arxiv.2605.16358,
title = {LEAF: A Living Benchmark for Event-Augmented Forecasting},
author = {Mingtian Tan and Mihir Parmar and Palash Goyal and Chun-Liang Li and Nanyun Peng and Thomas Hartvigsen and Jinsung Yoon and Tomas Pfister},
journal= {arXiv preprint arXiv:2605.16358},
year = {2026}
}
备注
12 tables, 6 figures, 39 pages