中文

人类 vs 大型语言模型:高级 AI 时代的判断性预测

机器学习 2024-05-20 v2 计算机与社会

摘要

本研究调查了零售业中人类专家与大型语言模型(LLM)的预测准确率,特别是在常规销售期和促销销售期。通过采用包含 123 名人类预测员和五个 LLM(包括 ChatGPT4、ChatGPT3.5、Bard、Bing 和 Llama2)的受控实验设置,我们通过平均绝对百分比误差评估了预测精度。我们的分析集中在以下因素对预测员表现的影响:支持的统计模型(基线与高级)、产品是否促销以及外部影响的性质。研究结果表明,LLM 在预测准确率上并未始终优于人类,且高级统计预测模型也未能统一提升人类预测员或 LLM 的表现。人类和 LLM 预测员都表现出预测误差增加的情况,特别是在促销期间和正向外部影响下。我们的研究结果呼吁在将 LLM 整合到实际预测流程中时需谨慎考虑。

关键词

引用

@article{arxiv.2312.06941,
  title  = {Humans vs Large Language Models: Judgmental Forecasting in an Era of Advanced AI},
  author = {MAhdi Abolghasemi and Odkhishig Ganbold and Kristian Rotaru},
  journal= {arXiv preprint arXiv:2312.06941},
  year   = {2024}
}