中文

评估大语言模型在现实世界预测中的表现:对抗专家预测者的比较

机器学习 2025-08-06 v3 人工智能 计算与语言

摘要

大型语言模型(LLM)在多样化任务中展现出惊人的能力,但其预测未来事件的能力仍受到 insufficient 关注。一年 ago,大型语言模型在准确度上难以接近人类众所周知的水平。本文在 Metaculus 上评估了最新的大型语言模型,对其在 464 个预测问题上的表现进行了与顶级预测者的比较。前沿模型虽然在 Brier 分数上显然超过了人类众所周知,但仍显著低于一组专家的表现。

关键词

引用

@article{arxiv.2507.04562,
  title  = {Evaluating LLMs on Real-World Forecasting Against Expert Forecasters},
  author = {Janna Lu},
  journal= {arXiv preprint arXiv:2507.04562},
  year   = {2025}
}