中文

硅谷群体的智慧:LLM 集成预测能力媲美人类群体准确度

计算机与社会 2024-07-23 v6 人工智能 计算与语言 机器学习

摘要

实践中的人类预测准确度依赖于“群体智慧”效应,即通过汇总众多个体预测者的预测,可显著提升对未来事件的预测效果。过去关于大语言模型(LLM)预测能力的研究表明,作为个体预测者,前沿 LLM 的表现不及人类群体预测锦标赛汇总这一黄金标准。在研究 1 中,我们通过使用由十二个 LLM 组成的群体这一 LLM 集成方法扩展了此项研究。我们将 31 个二元问题上的聚合 LLM 预测与来自为期三个月的预测锦标赛中 925 名人类预测者群体的预测进行了比较。我们预先注册的主要分析显示,LLM 群体的表现优于简单的无信息基准,且与人类群体在统计上无显著差异。在探索性分析中,我们发现这两种方法在中等效应量等价界限方面是等效的。我们还观察到一种顺从效应,尽管正负决议几乎各占一半,但模型预测的平均值显著高于 50%。此外,在研究 2 中,我们测试了通过借鉴人类认知输出是否能提高 LLM(GPT-4 和 Claude 2)的预测效果。我们发现,这两个模型的预测准确度均受益于将人类预测中位数作为信息输入,准确度提高了 17% 至 28%:尽管这导致预测准确度低于简单平均人类和机器预测的结果。我们的结果表明,LLM 能够通过预测聚合这一简单且实用的方法,实现媲美人类群体预测锦标赛的预测准确度。这在 LLM 中复现了“群体智慧”效应,并为其在社会各领域的广泛应用开辟了道路。

关键词

引用

@article{arxiv.2402.19379,
  title  = {Wisdom of the Silicon Crowd: LLM Ensemble Prediction Capabilities Rival Human Crowd Accuracy},
  author = {Philipp Schoenegger and Indre Tuminauskaite and Peter S. Park and Philip E. Tetlock},
  journal= {arXiv preprint arXiv:2402.19379},
  year   = {2024}
}

备注

20 pages; 13 visualizations (nine figures, four tables)