中文

FinanceQA:面向大语言模型金融分析能力评估的基准

机器学习 2025-01-31 v1 计算与语言

摘要

FinanceQA 是一个测试套件,用于评估 LLM 在反映真实投资工作的复杂数值金融分析任务上的表现。尽管近年来取得了诸多进展,现有 LLM 仍无法满足金融机构的严格精度要求:在模拟对冲基金、私募股权公司、投资银行及其他金融机构实际工作分析的逼真任务中,模型约有 60% 的失败率。其主要挑战包括手工铺陈各项指标、遵循标准的会计与企业估值惯例,以及在信息不完整的情况下进行分析——尤其是在需要生成假设的多步骤任务中。这一性能差距凸显了现有 LLM 能力与专业金融分析需求之间的脱节,而当前的测试架构未能充分覆盖这些需求。实验结果表明,需要更高质量的训练数据来支持此类任务,我们利用 OpenAI 的微调 API 对此进行了实验。FinanceQA 已公开发布于 [this https URL](https://huggingface.co/datasets/AfterQuery/FinanceQA)。

关键词

引用

@article{arxiv.2501.18062,
  title  = {FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models},
  author = {Spencer Mateega and Carlos Georgescu and Danny Tang},
  journal= {arXiv preprint arXiv:2501.18062},
  year   = {2025}
}

备注

10 pages, 7 figures