自动化生成与解决AI评估的预测问题
机器学习
2026-03-11 v2 人工智能
摘要
预测未来事件在决策中具有高价值,是衡量通用智能的可靠方法之一。由于预测本质上是概率性的,开发和评估AI预测模型需要生成大量多样且具挑战性的问题,并准确地解决这些问题。以往自动化劳动密集型工作的尝试依赖固定数据源(如天气、股票),限制了其多样性和实用性。本文提出了一种利用LLM驱动的网络研究代理自动生成和解决高质量预测问题的系统。我们使用该系统生成了1499个多样的真实世界预测问题,并在数月后对其进行解决。我们估计该系统约96%的时间能产生可验证且无歧义的问题,超过领先的人类策展平台Metaculus。我们还发现该系统在解决问题方面的准确率约为95%。我们验证,由更智能的LLM驱动的预测代理在这些问题上表现更好(Gemini 3 Pro的Brier分数为0.134,GPT-5为0.149,Gemini 2.5 Flash为0.179)。最后,我们演示了该系统如何被用于直接改进预测,通过在生成的问题集合上评估问题分解策略,Brier分数显著提升(0.132 vs. 0.141)。
引用
@article{arxiv.2601.22444,
title = {Automating Forecasting Question Generation and Resolution for AI Evaluation},
author = {Nikos I. Bosse and Peter Mühlbacher and Jack Wildman and Lawrence Phillips and Dan Schwarz},
journal= {arXiv preprint arXiv:2601.22444},
year = {2026}
}
备注
41 pages, 4 figures