金融推理提升:大语言模型在 CFA Level III 上的综合评估
计算与语言
2025-09-23 v2 人工智能
摘要
随着金融机构日益采用大语言模型(LLM),针对特定领域的严格评估对于负责任的部署至关重要。本文提出了综合基准测试,评估 23 种最先进的大语言模型在 Chartered Financial Analyst(CFA)Level III 考试中的表现——这是高级金融推理的黄金标准。我们评估了多选题(MCQs)和论文式回答,使用包括链式思维(Chain-of-Thought)和自我发现(Self-Discover)等多种提示策略。我们的评估结果显示,领先模型展现出强大的能力,复合得分分别为 79.1%(o4-mini)和 77.3%(Gemini 2.5 Flash)。这些结果是在修订了更严格的论文评分方法下实现的,表明大语言模型在高风险金融应用方面已取得显著进展。我们的发现为从业者在模型选择方面提供了关键指导,并突显了成本效益部署和对专业基准绩效进行细致解释方面的剩余挑战。
引用
@article{arxiv.2507.02954,
title = {Advanced Financial Reasoning at Scale: A Comprehensive Evaluation of Large Language Models on CFA Level III},
author = {Pranam Shetty and Abhisek Upadhayaya and Parth Mitesh Shah and Srikanth Jagabathula and Shilpi Nayak and Anna Joo Fee},
journal= {arXiv preprint arXiv:2507.02954},
year = {2025}
}
备注
Accepted at FinLLM @ IJCAI 2025