AI 预测 AGI:利用 AGI 预测与同行评审探索 LLMs 的复杂推理能力
人工智能
2025-04-23 v2
摘要
我们委托 16 个最先进的大语言模型(LLMs)估计到 2030 年人工通用智能(AGI)出现的概率。为评估这些预测的质量,我们实现了一个自动化的同行评审流程(LLM-PR)。LLMs 的估计范围广泛,从 3%(Reka-Core)到 47.6%(GPT-4o),中位数为 12.5%。这些估计与最近一次专家调查的 10% AGI 概率(预计到 2027 年)密切一致,凸显了 LLMs 在预测复杂、推测性情景方面的相关性。LLM-PR 流程表现出高可靠性,ICC(跨组相关系数)为 0.79,反映出模型间评分的显著一致性。在这些模型中,Pplx-70b-online 成绩最佳,而 Gemini-1.5-pro-api 排名最低。与外部基准(如 LMSYS Chatbot Arena)进行的交叉比较显示,LLM 排名在不同评估方法中保持一致,这表明现有基准可能未涵盖一些与 AGI 预测相关的技能。我们进一步探索了基于外部基准的加权方案,以优化 LLMs 预测与人类专家预测之间的对齐。这一分析导致开发了新的“AGI 基准”,旨在突出 AGI 相关任务中的性能差异。我们的发现为 LLMs 在推断、跨学科预测任务中的能力提供了洞见,并强调了在复杂、不确定的真实世界情景中评估 AI 性能的日益增长的需求。
引用
@article{arxiv.2412.09385,
title = {AI Predicts AGI: Leveraging AGI Forecasting and Peer Review to Explore LLMs' Complex Reasoning Capabilities},
author = {Fabrizio Davide and Pietro Torre and Leonardo Ercolani and Andrea Gaggioli},
journal= {arXiv preprint arXiv:2412.09385},
year = {2025}
}
备注
47 pages, 8 figures, 17 tables, appendix with data and code