中文

金融问答系统的系统评估语料库

计算与语言 2024-06-21 v1

摘要

金融领域经常处理大量长文档,这些文档对于日常运营至关重要。人们致力于自动化金融数据分析,但存在一个持续的挑战——数据集稀缺,难以准确反映实际任务以进行模型评估。现有数据集常受限于规模、上下文或与实际应用的相关性。此外,LLM 目前在平行的文本上进行训练,限制了对模型训练期未接触的新数据或文档的访问,以实现无偏见的评估。我们提出 SEC-QA—a 持续的数据集生成框架,具有两个关键特征:1) 半自动生成跨越多个长上下文金融文档的问答对,这些问答对更能代表现实的金融场景;2) 能够利用最新的公共文档集合持续刷新数据集,这些文档尚未被 LLM 所摄取。我们的实验表明,当前的检索增强生成方法在回答这些具有挑战性的多文档问题方面系统性地失败。为此,我们引入一种基于程序思维(program-of-thought)的问答系统,提高了执行复杂信息检索和量化推理管道的能力,从而提高问答准确率。

关键词

引用

@article{arxiv.2406.14394,
  title  = {SEC-QA: A Systematic Evaluation Corpus for Financial QA},
  author = {Viet Dac Lai and Michael Krumdick and Charles Lovering and Varshini Reddy and Craig Schmidt and Chris Tanner},
  journal= {arXiv preprint arXiv:2406.14394},
  year   = {2024}
}