中文

大语言模型的预测能力:来自真实世界预测竞赛的证据

计算机与社会 2023-10-23 v1 人工智能 计算与语言 机器学习

摘要

准确预测未来将是人工智能能力的一个重要里程碑。然而,关于大语言模型对未来事件提供概率性预测能力的研究仍处于起步阶段。为实证检验这一能力,我们将 OpenAI 最先进的大语言模型 GPT-4 注册参加了在 Metaculus 平台上举办的一场为期三个月的预测竞赛。该竞赛于 2023 年 7 月至 10 月进行,吸引了 843 名参与者,涵盖包括大型科技公司、美国政治、病毒爆发和乌克兰冲突在内的多样化主题。聚焦于二元预测,我们表明 GPT-4 的概率预测显著不如人类群体中位预测准确。我们发现 GPT-4 的预测与对每个问题都赋予 50% 概率的无信息预测策略无显著差异。我们探讨了一种可能的解释,即 GPT-4 可能倾向于预测接近量表中间点的概率,但我们的数据并不支持这一假设。总体而言,我们发现与人类社会群体中位预测相比,GPT-4 在真实世界预测任务中显著表现不佳。对此表现不佳的一种可能解释是,在真实世界预测竞赛中,预测时真实答案确实未知;不同于专业考试或时间序列预测等其他基准任务,后者中的优异表现可能至少部分源于答案从训练数据中被记忆。这使得真实世界预测竞赛成为今后检验人工智能通用推理与预测能力的理想环境。

关键词

引用

@article{arxiv.2310.13014,
  title  = {Large Language Model Prediction Capabilities: Evidence from a Real-World Forecasting Tournament},
  author = {Philipp Schoenegger and Peter S. Park},
  journal= {arXiv preprint arXiv:2310.13014},
  year   = {2023}
}

备注

13 pages, six visualizations (four figures, two tables)