中文

面向长文档检索的多视图内容感知索引

计算与语言 2024-04-24 v1

摘要

长文档问答(DocQA)旨在从超过 1 万字的长文档中回答问题。它们通常包含章节、子章节和段落划分等内容结构。然而,长文档的索引方法仍未得到充分探索,而现有系统通常采用固定长度分块。由于它们不考虑内容结构,生成的块可能会排除重要信息或包含无关内容。受此启发,我们提出了多视图内容感知索引,通过 将结构化文档分割为内容块,以及 以原始文本、关键词和摘要视图表示每个内容块,来实现更有效的长 DocQA。我们强调 MC-indexing 既不需要训练也不需要微调。具有即插即用的能力,它可以与任何检索器无缝集成以提升其性能。此外,我们提出了一个长 DocQA 数据集,其中不仅包含问答对,还包含文档结构和答案范围。与最先进的分块方案相比,MC-indexing 在 top k=1、5、3、5 和 10 时分别显著提高了 42.8%、30.0%、23.9% 和 16.3% 的召回率。这些改进的分数是通过广泛的实验在 8 个广泛使用的检索器(2 个稀疏检索器和 6 个密集检索器)上的平均值。

关键词

引用

@article{arxiv.2404.15103,
  title  = {Multi-view Content-aware Indexing for Long Document Retrieval},
  author = {Kuicai Dong and Derrick Goh Xin Deik and Yi Quan Lee and Hao Zhang and Xiangyang Li and Cong Zhang and Yong Liu},
  journal= {arXiv preprint arXiv:2404.15103},
  year   = {2024}
}