TimeSeek:代理类预测者的时间可靠性
人工智能
2026-04-07 v1
摘要
我们提出TimeSeek,一个用于研究代理类大语言模型预测者在预测市场生命周期中可靠性变化的基准测试。我们在150个CFTC监管的Kalshi二元市场中评估10个前沿模型,在五个时间点进行评估,分别考虑有无网络搜索,共计进行15,000次预测。模型在市场生命周期早期以及高不确定性市场中最具竞争力,但在接近决议时以及强共识市场中竞争力大幅下降。网络搜索在所有模型整体上提高了平均Brier Skill Score(BSS),但在12%的模型-时间点组合中反而下降,表明检索在平均情况下有益,但并非在所有情况下都如此。简单的两模型集成在降低误差方面有效,但未超过市场整体水平。这些描述性结果动机了时间感知的评估以及选择性 deferral 政策,而非单一市场快照或统一工具使用环境。
引用
@article{arxiv.2604.04220,
title = {TimeSeek: Temporal Reliability of Agentic Forecasters},
author = {Hamza Mostafa and Om Shastri and Dennis Lee},
journal= {arXiv preprint arXiv:2604.04220},
year = {2026}
}
备注
Workshop paper. 11 pages including references