评估大型语言模型的金融推理能力:基于 CFA 的基准测试研究
计算与语言
2025-09-08 v1 人工智能
摘要
大型语言模型的快速发展为金融应用带来了重大机遇,但在专门金融语境下的系统性评估仍然有限。本研究首次利用来自全球最严谨的专业认证 CFA Level I-III 官方模拟考试的 1,560 道选择题,对最先进的 LLM 进行了全面评估,这些考试反映了现实世界金融分析的复杂性。我们比较了以核心设计优先级区分的模型:多模态且计算能力强大的、推理专门化且高度准确的,以及轻量级效率优化的。我们在零样本提示下评估模型,并通过一个集成官方 CFA 课程内容的新型检索增强生成(RAG)流水线进行评估。该 RAG 系统通过分层知识组织和结构化查询生成实现了精确的领域特定知识检索,显著提升了专业金融认证评估中的推理准确性。结果显示,面向推理的模型在零样本设置下持续优于其他模型,而 RAG 流水线则提供了实质性的改进,特别是在复杂场景中。全面的错误分析表明,知识缺口是主要的失败模式,而文本可读性的影响极小。这些发现为 LLM 在金融领域的部署提供了可操作的见解,为从业者提供了关于模型选择和成本性能优化的循证指导。
引用
@article{arxiv.2509.04468,
title = {Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study},
author = {Xuan Yao and Qianteng Wang and Xinbo Liu and Ke-Wei Huang},
journal= {arXiv preprint arXiv:2509.04468},
year = {2025}
}