评估大语言模型的会计推理能力
计算与语言
2026-01-13 v1
摘要
大语言模型正在改变多个领域的学习、认知和研究方式。将其有效地集成到会计等专业领域,是企业数字化转型的关键挑战。为此,我们定义了垂直领域会计推理,提出源于代表性 GLM 模型训练数据特征分析的评估准则。这些准则支持系统化的会计推理研究,并为性能改进提供基准。使用这一框架,我们评估了 GLM-6B、GLM-130B、GLM-4 和 OpenAI GPT-4 在会计推理任务中的表现。结果表明,提示词设计对性能影响显著,GPT-4 显示出最强的能力。尽管取得了这些进步,但当前模型仍不足以应用于实际的企业会计,表明需要进一步优化以释放其实际价值。
引用
@article{arxiv.2601.06707,
title = {Evaluating Accounting Reasoning Capabilities of Large Language Models},
author = {Jie Zhou and Xin Chen and Jie Zhang and Hai Li and Jie Wang and Zhe Li},
journal= {arXiv preprint arXiv:2601.06707},
year = {2026}
}