Fin-RATE:面向LLM的真实财务分析与跟踪评估基准
计算工程、金融与科学
2026-02-17 v3 人工智能
摘要
随着大型语言模型 (LLM) 在金融领域的日益广泛部署,LLM 正在被期望解析复杂的监管披露内容。然而,现有基准往往仅关注细节,无法反映需要综合多个文件、多个报告期以及多个企业信息的专业分析的复杂性。此外,这些基准无法消除错误来源是来自检索失败、生成不准、领域推理错误,还是对查询或上下文的误解,从而难以精确诊断性能瓶颈。为弥合这一差距,我们引入 Fin-RATE,一个基于美国证券交易委员会 (SEC) 文件构建的基准,模拟金融分析师的工作流程,包含三个路径:(i) 对单个披露内容的细致推理 (ii) 在共享主题下进行跨实体比较 (iii) 跟踪同一企业在不同报告期间的演变。我们对 17 个领先 LLM 进行了基准测试,包括开源、封闭和金融专业模型,分别在真实上下文和检索增强设置下进行测试。结果显示,随着任务从单文档推理转向纵向和跨实体分析,准确率分别下降 18.60% 和 14.35%。这种下降由比较幻觉、时空错位和实体错位驱动,并进一步体现在推理质量和事实一致性的下降——这些局限性尚未被现有基准正式分类或量化。
引用
@article{arxiv.2602.07294,
title = {Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings},
author = {Yidong Jiang and Junrong Chen and Eftychia Makri and Jialin Chen and Peiwen Li and Ali Maatouk and Leandros Tassiulas and Eliot Brenner and Bing Xiang and Rex Ying},
journal= {arXiv preprint arXiv:2602.07294},
year = {2026}
}