大语言模型预测人类行为的能力如何?对其预训练知识的一种度量
计量经济学
2026-01-21 v1 人工智能
机器学习
摘要
大语言模型(LLMs)正越来越多地被用于预测人类行为。我们提出了一种度量方法,用于评估预训练大语言模型为此类预测带来了多少知识:即其等效样本量,定义为达到该大语言模型预测准确度所需的特定任务数据量。我们通过将固定大语言模型在给定领域的预测误差,与在不断增加领域特定数据样本上训练的灵活机器学习模型的预测误差进行比较,来估计这一度量。我们进一步通过为交叉验证预测误差建立新的渐近理论,提供了一个统计推断程序。最后,我们将此方法应用于收入动态面板研究。我们发现,大语言模型对某些经济变量编码了相当多的预测信息,但对其他变量则少得多,这表明它们作为领域特定数据替代品的价值在不同情境下差异显著。
引用
@article{arxiv.2601.12343,
title = {How Well Do LLMs Predict Human Behavior? A Measure of their Pretrained Knowledge},
author = {Wayne Gao and Sukjin Han and Annie Liang},
journal= {arXiv preprint arXiv:2601.12343},
year = {2026}
}