超出报告截止日期:大型语言模型在财务知识方面的不足之处
计算与语言
2025-07-30 v2
摘要
大型语言模型(Large Language Models, LLMs)经常被用作问答知识源。虽然已知 LLMs 可能缺乏对实时数据或模型截止日期之后产生的数据的访问,但有关其知识跨度如何涵盖历史信息的问题尚不明了。本研究使用美国上市公司的财务数据,对 LLMs 的知识范围进行评估,通过评估超过 19.7 万个问题并将模型响应与事实数据进行比较。我们进一步探讨了公司特征(如规模、零售投资、机构关注度以及财务文件可读性)对 LLMs 知识准确性的影响。我们的结果表明,LLMs 对过去的财务表现了解不够,但对更大的公司和更近期的信息显示出更强的 awareness。有趣的是,我们的分析也表明,LLMs 在处理更大的公司时更容易产生幻觉,尤其是针对更近年份的数据。该代码、提示和模型输出均可在 GitHub 上获取。
引用
@article{arxiv.2504.00042,
title = {Beyond the Reported Cutoff: Where Large Language Models Fall Short on Financial Knowledge},
author = {Agam Shah and Liqin Ye and Sebastian Jaskowski and Wei Xu and Sudheer Chava},
journal= {arXiv preprint arXiv:2504.00042},
year = {2025}
}
备注
Paper accepted at CoLM 2025