中文

FinTextQA:面向长篇金融问答的数据集

计算与语言 2025-03-04 v1 人工智能

摘要

准确评估金融问答(QA)系统的性能,必须构建涵盖多样问题类型和情境的全面数据集。然而,现有金融QA数据集在覆盖范围和问题复杂度方面存在不足。本文引入FinTextQA,一个用于金融领域的长篇问答(LFQA)数据集。FinTextQA包含1262个高质量、标注可靠的QA对,来源于金融教材和政府机构网站。此外,我们开发了一个基于检索增强生成(RAG)的LFQA系统,包括嵌入器、检索器、重排序器和生成器。采用人工排序、自动评估指标以及GPT-4评分等多维度评估方法,对不同LFQA系统配置在增强噪声条件下的性能进行基准测试。结果表明:(1)在所比较的所有生成器中,Baichuan2-7B在准确率方面与GPT-3.5-turbo相近;(2)在本数据集上,最有效的系统配置将嵌入器、检索器、重排序器和生成器分别设置为Ada2、Automated Merged Retrieval、Bge-Reranker-Base和Baichuan2-7B;(3)在上下文长度达到特定阈值后,模型对噪声的敏感度会降低。

关键词

引用

@article{arxiv.2405.09980,
  title  = {FinTextQA: A Dataset for Long-form Financial Question Answering},
  author = {Jian Chen and Peilin Zhou and Yining Hua and Yingxin Loh and Kehui Chen and Ziyuan Li and Bing Zhu and Junwei Liang},
  journal= {arXiv preprint arXiv:2405.09980},
  year   = {2025}
}