中文

伪日期检验:我们能信赖LLM在宏观经济预测中的样本内准确性吗?

计量经济学 2026-03-31 v2

摘要

大型语言模型(LLM)是经济学家开始在实证研究中应用的机器学习工具类型。其中一种应用是对LLM进行背调测试,尽管它们是在用于估计其预测绩效的同一数据上训练的。我们能将这些样本内准确性结果外推到模型的样本外绩效吗?为了回答这个问题,我们发展了一系列提示敏感性测试,称为伪日期检验。这些测试旨在检测LLM样本内预测中两种偏差:前瞻偏差和情境偏差。根据实证结果,本研究中测试的现代LLM中没有任何一个通过我们的第一项测试,这表明它们的样本内预测中存在前瞻偏差。

关键词

引用

@article{arxiv.2601.07992,
  title  = {Fake Date Tests: Can We Trust In-sample Accuracy of LLMs in Macroeconomic Forecasting?},
  author = {Alexander Eliseev and Sergei Seleznev},
  journal= {arXiv preprint arXiv:2601.07992},
  year   = {2026}
}