中文

FinVerBench:大语言模型财务报表验证的基准与校准性研究

人工智能 2026-05-29 v1

摘要

我们提出 FinVerBench,一个用于财务报表验证的数据集与有效性研究:确定公司财务报表是否从模型显示的信息中数值上保持一致。FinVerBench 基于 43 家 S&P 500 公司的 SEC 10-K XBRL 文件构建,定义四类错误分类涵盖算术、跨报表关联、年度比较和幅度扰动。我们尝试了十五种当代 LLM 评估方法并报告十四次完整运行;因 40/108 gateway 调用失败,Gemini 2.5 Pro 的一次运行被排除在主要比较之外。所有二元指标均排除 underdetermined 正实例(因扰动的线项目标未被渲染),剩余 105 个可观测诊断子集(43 个干净,62 个注入错误)。在 unrounded 可观测子集上使用原有 guided-checklist 提示,14 次完整 LLM 运行中 9 次产生 95-100% 的假阳性,而另一运行实现 0% 观察到的假阳性。在更真实的四舍五入变体上,校准模型的召回率为 79.0%,观察到的假阳性率为 0%,而与 unrounded 可观测子集相比,召回率为 100.0%。这些结果支持一种 construct-validity 结论而非最终排行榜:财务报表验证不仅仅是算术检测,而是在不可完全观测、提示诱导假设以及真实数值渲染条件下的校准判断。FinVerBench 和所有代码均公开可用。

关键词

引用

@article{arxiv.2605.29586,
  title  = {FinVerBench: Benchmark Validity and Calibration in Large Language Model Financial Statement Verification},
  author = {Silu Panda},
  journal= {arXiv preprint arXiv:2605.29586},
  year   = {2026}
}

备注

37 pages, 9 figures