金融智能体基准: 对 LLM 进行真实金融研究任务的基准测试
计算工程、金融与科学
2025-08-05 v1
摘要
人工智能 (AI) 技术已然成为金融分析和金融行业的变革性力量,尽管关于大型语言模型 (LLM) 在该领域完全能力的重大疑问仍然存在。我们提出了金融智能体基准 (Finance Agent Benchmark),该基准包含具有挑战性和多样性的真实金融研究问题,要求 LLM 使用最新的 SEC filing 执行复杂分析。我们依据由来自银行、对冲基金和私募股权公司的专家共同制定的九类金融任务分类构建了该基准。数据集包括 537 个专家撰写的问题,覆盖从信息检索到复杂金融建模的各种任务,每道问题均经过严格的审查过程,以确保准确性和相关性。此外,我们实现了一个智能体框架,为 LLM 提供足以产生准确响应的工具,包括 Google 搜索和 EDGAR 数据库访问。总体而言,金融智能体基准为衡量 LLM 驱动的金融智能体进展提供了全面的测试平台。我们的评估显示当前 AI 能力存在显著局限——即使是表现最好的模型 (OpenAI o3),在平均每次查询费用为 $3.79 的情况下,仅达到了 46.8% 的准确率。这凸显了在高风险金融环境中实现可靠部署还需进一步发展。
关键词
引用
@article{arxiv.2508.00828,
title = {Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks},
author = {Antoine Bigeard and Langston Nashold and Rayan Krishnan and Shirley Wu},
journal= {arXiv preprint arXiv:2508.00828},
year = {2025}
}