评估大语言模型在现实世界预测中的表现:对抗专家预测者的比较
机器学习
2025-08-06 v3 人工智能
计算与语言
摘要
大型语言模型(LLM)在多样化任务中展现出惊人的能力,但其预测未来事件的能力仍受到 insufficient 关注。一年 ago,大型语言模型在准确度上难以接近人类众所周知的水平。本文在 Metaculus 上评估了最新的大型语言模型,对其在 464 个预测问题上的表现进行了与顶级预测者的比较。前沿模型虽然在 Brier 分数上显然超过了人类众所周知,但仍显著低于一组专家的表现。
引用
@article{arxiv.2507.04562,
title = {Evaluating LLMs on Real-World Forecasting Against Expert Forecasters},
author = {Janna Lu},
journal= {arXiv preprint arXiv:2507.04562},
year = {2025}
}