FinReasoning:面向可靠金融研究报告的分层基准
计算与语言
2026-05-11 v2
摘要
大型语言模型(LLMs)正日益被部署在金融研究工作流程中,其角色正从为人类分析师提供单一模型辅助,逐渐演变为多个智能体之间的自主协作。然而,实际部署仍暴露出事实错误、数值不一致和浅层分析等问题,这些问题可能扭曲对企业基本面的评估,并引发严重的经济损失。虽然现有基准试图评估此类失误,但它们在单次评估中对生成分析的所有方面进行打分,无法区分模型是在基础阶段(如审计和纠正)中失败,还是在生成研究级别洞见方面表现不足。因此,这些方法掩盖了能力瓶颈以及对于多智能体角色分配至关重要的专业优势。为解决此问题,我们提出 FinReasoning,一个分层基准,将金融研究的核心能力分为语义一致性、数据对齐和深层洞察三个维度。我们进一步提出了细粒度评估框架,加强了幻觉-纠正评估,并纳入 12 项指标的评估标准。FinReasoning 揭示了不同模型类型之间清晰的能力分层。闭源模型(如豆包种子 1.8)整体表现强劲,更适合作为多智能体金融系统中的核心推理智能体;开源通用模型(如 Qwen3-235B)在能力上存在明显分化,在语义一致性方面始终表现不足,不适合作为质量敏感的生成任务;金融领域模型(如 Fin-R1)生成的洞见适中,但缺乏基础审计技能。我们的工作已在多个实际场景中进行试点测试。该资源已公开于 https://github.com/TongjiFinLab/FinReasoning。
引用
@article{arxiv.2603.19254,
title = {FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting},
author = {Yiyun Zhu and Yidong Jiang and Ziwen Xu and Yinsheng Yao and Dawei Cheng and Jinru Ding and Jie Xu},
journal= {arXiv preprint arXiv:2603.19254},
year = {2026}
}