中文

面向标准化文档开放领域金融问答的层级检索与证据整理

信息检索 2025-11-07 v3 人工智能 计算与语言

摘要

基于检索增强生成(RAG)的大型语言模型(LLM)因其在于知识密集型任务上的卓越表现而在金融领域被广泛使用。然而,标准化文档(例如 SEC 备案文件)共享相似的格式,如重复的样板文本和相似的表格结构。这种相似性迫使传统 RAG 方法误判近似重复的文本,导致重复检索,从而破坏了准确性和完整性。为了解决这些问题,我们提出了层级检索与证据整理框架。我们的方法首先执行层级检索以减少相似文本之间的混淆。它首先检索相关文档,然后从文档中选择最相关的段落。证据整理过程移除不相关的段落。在必要时,它会自动生成补充查询以收集缺失的信息。为了评估我们的方法,我们构建并发布了一个大规模开放领域金融问答基准,包含 145,897 份 SEC 文档和 1,595 个问答对。我们的代码和数据可在 https://github.com/deep-over/LOFin-bench-HiREC 获取。

关键词

引用

@article{arxiv.2505.20368,
  title  = {Hierarchical Retrieval with Evidence Curation for Open-Domain Financial Question Answering on Standardized Documents},
  author = {Jaeyoung Choe and Jihoon Kim and Woohwan Jung},
  journal= {arXiv preprint arXiv:2505.20368},
  year   = {2025}
}

备注

ACL 2025 (Findings)