中文

FinanceBench:面向金融问答的新基准

计算与语言 2023-11-21 v1 人工智能 计算工程、金融与科学 机器学习

摘要

FinanceBench 是一个首创的测试套件,用于评估 LLM 在开卷金融问答(QA)上的表现。它包含 10,231 个关于上市公司的问答,并附有相应答案与证据字符串。FinanceBench 中的问题具有生态有效性且涵盖多样场景。它们旨在清晰明确、易于作答,以作为最低性能标准。我们在 FinanceBench 的 150 个案例样本上测试了 16 种最先进的模型配置(包括 GPT-4-Turbo、Llama2 与 Claude2,结合向量库与长上下文提示),并人工审阅其答案(n=2,400)。这些案例已开源。我们表明现有 LLM 在金融 QA 上存在明显局限。值得注意的是,使用检索系统的 GPT-4-Turbo 错误回答或拒答了 81% 的问题。尽管使用更长上下文窗口输入相关证据等增强技术可提升表现,但因延迟增加而无法用于企业环境,且不能支持更大的金融文档。我们发现所考察的所有模型均表现出幻觉等弱点,限制了其在企业中的适用性。

关键词

引用

@article{arxiv.2311.11944,
  title  = {FinanceBench: A New Benchmark for Financial Question Answering},
  author = {Pranab Islam and Anand Kannappan and Douwe Kiela and Rebecca Qian and Nino Scherrer and Bertie Vidgen},
  journal= {arXiv preprint arXiv:2311.11944},
  year   = {2023}
}

备注

Dataset is available at: https://huggingface.co/datasets/PatronusAI/financebench