AI 增强预测:大语言模型助手提升人类预测准确性
计算机与社会
2024-08-23 v2 人工智能
计算与语言
机器学习
摘要
大语言模型(LLM)在许多领域表现匹敌甚至超越人类。本研究探讨了 LLM 在预测任务中增强人类判断的潜力。我们评估了两种 LLM 助手对人类预测者的影响:一种旨在提供高质量(“超级预测”)建议,另一种则被设计为过度自信且忽视基准率,从而提供带有噪声的预测建议。我们将使用这些助手的参与者与对照组进行比较,对照组使用的是不提供数值预测或不进行明确预测讨论的较落后模型。参与者(N = 991)回答了一组六个预测问题,并可选择在整个过程中咨询其分配的 LLM 助手。我们预先注册的分析表明,与对照组相比,与我们的任一前沿 LLM 助手互动均能显著提高预测准确性,增幅在 24% 至 28% 之间。探索性分析显示,其中一个预测项目存在显著的离群值效应;若排除该项目,我们发现超级预测助手将准确性提高了 41%,而噪声助手提高了 29%。我们进一步考察了 LLM 预测增强是否不成比例地惠及技能较低的预测者、是否因降低预测多样性而削弱群体智慧,或其有效性是否随问题难度而变化。我们的数据并未一致支持这些假设。我们的结果表明,与不提供具体预测建议的较弱模型相比,获取前沿 LLM 助手(即使是噪声助手)可作为认知要求较高任务中的有益决策辅助工具。然而,离群值的影响表明,需要进一步研究该模式的稳健性。
引用
@article{arxiv.2402.07862,
title = {AI-Augmented Predictions: LLM Assistants Improve Human Forecasting Accuracy},
author = {Philipp Schoenegger and Peter S. Park and Ezra Karger and Sean Trott and Philip E. Tetlock},
journal= {arXiv preprint arXiv:2402.07862},
year = {2024}
}
备注
22 pages pages (main text comprised of 19 pages, appendix comprised of three pages). 10 visualizations in the main text (four figures, six tables), three additional figures in the appendix