中文

EDINET-Bench: 使用日本财务报表评估LLM在复杂金融任务上的表现

统计金融 2026-03-06 v2 计算工程、金融与科学 计算与语言 机器学习

摘要

大语言模型(LLM)取得了显著进展,在数学和编码等领域的多个基准测试中超越了人类表现。这一进展的关键驱动力是基准数据集的开发。相比之下,金融领域由于其对专业专业知识的需求而具有更高的进入门槛,基准测试相对数学或编码领域较为稀缺。我们引入了EDINET-Bench,一个开源的日本金融基准测试,旨在评估LLM在会计欺诈检测、收益预测和行业分类等具有挑战性的任务上。EDINET-Bench由日本公司十年来的年度报告构建而成。这些任务要求模型处理完整的年度报告并整合多个表格和文本部分的信息,需要专家级别的推理,即使对人类专业人员也具有挑战性。我们的实验表明,即使是最先进的LLM在该领域也表现不佳,在欺诈检测和收益预测等二分类任务上仅比逻辑回归略好。我们的结果表明,仅仅将报告以直接的方式提供给LLM是不够的。这凸显了对更好地反映金融专业人员运行环境的基准框架的需求,需要更丰富的支架,如现实模拟和任务特定的推理支持,以实现更有效的问题解决。我们公开了数据集和代码以支持未来研究。

关键词

引用

@article{arxiv.2506.08762,
  title  = {EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements},
  author = {Issa Sugiura and Takashi Ishida and Taro Makino and Chieko Tazuke and Takanori Nakagawa and Kosuke Nakago and David Ha},
  journal= {arXiv preprint arXiv:2506.08762},
  year   = {2026}
}

备注

Accepted to ICLR 2026