中文

大语言模型中的会计推理:概念、评估与实证分析

计算与语言 2026-02-10 v2

摘要

大语言模型 (LLM) 正在深刻改变各类领域的学习范式、认知过程和研究方法。随着其应用的扩展,有效地将 LLM 集成到专业领域并阐明其在领域特定应用中的作用,已成为企业数字化转型和更广泛社会发展的关键挑战。在会计领域,成功的集成需要系统性地理解 LLM 的领域特定推理能力。本研究引入会计推理的概念,提出一套基于分析代表性 GLM 系列模型训练数据特征的评估标准。这些标准为研究会计导向的推理范式提供了基础,同时为评估和改进模型性能提供了基准。建立在此框架之上,我们评估了多个代表性 LLM,包括 GLM-6B、GLM-130B、GLM-4 和 GPT-4,在 various 会计推理任务中进行测试。我们的实验结果表明,提示工程策略可在不同模型之间产生不同的性能提升,其中 GPT-4 在整体会计推理能力方面表现最为突出。然而,结果表明当前的 LLM 仍不足以应用于实际会计应用。特别是,为充分实现 LLM 在该领域潜在价值,还需要进一步优化以适应企业级会计场景的部署。

关键词

引用

@article{arxiv.2512.22443,
  title  = {Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis},
  author = {Jie Zhou and Xin Chen and Jie Zhang and Zhe Li},
  journal= {arXiv preprint arXiv:2512.22443},
  year   = {2026}
}