中文

超出报告截止日期:大型语言模型在财务知识方面的不足之处

计算与语言 2025-07-30 v2

摘要

大型语言模型(Large Language Models, LLMs)经常被用作问答知识源。虽然已知 LLMs 可能缺乏对实时数据或模型截止日期之后产生的数据的访问,但有关其知识跨度如何涵盖历史信息的问题尚不明了。本研究使用美国上市公司的财务数据,对 LLMs 的知识范围进行评估,通过评估超过 19.7 万个问题并将模型响应与事实数据进行比较。我们进一步探讨了公司特征(如规模、零售投资、机构关注度以及财务文件可读性)对 LLMs 知识准确性的影响。我们的结果表明,LLMs 对过去的财务表现了解不够,但对更大的公司和更近期的信息显示出更强的 awareness。有趣的是,我们的分析也表明,LLMs 在处理更大的公司时更容易产生幻觉,尤其是针对更近年份的数据。该代码、提示和模型输出均可在 GitHub 上获取。

关键词

引用

@article{arxiv.2504.00042,
  title  = {Beyond the Reported Cutoff: Where Large Language Models Fall Short on Financial Knowledge},
  author = {Agam Shah and Liqin Ye and Sebastian Jaskowski and Wei Xu and Sudheer Chava},
  journal= {arXiv preprint arXiv:2504.00042},
  year   = {2025}
}

备注

Paper accepted at CoLM 2025