中文

基于局部预排序选取关键块的长文档信息检索能力

信息检索 2022-10-18 v3

摘要

在广泛的自然语言处理与信息检索任务中,基于Transformer的模型,特别是如BERT之类的预训练语言模型,已展现出巨大的有效性。然而,由于自注意力机制的二次复杂度,此类模型难以处理长文档。处理该问题的近期工作包括截断长文档(会丢失潜在相关信息)、将文档分割为多个段落(当段落数较大时可能导致信息遗漏和高计算复杂度),或修改自注意力机制使其如稀疏注意力模型般更稀疏(同样面临遗漏信息的风险)。我们在此遵循一种略有不同的方法:首先通过局部查询-块预排序选取长文档的关键块,然后将少量块聚合形成可由BERT等模型处理的短文档。在标准信息检索数据集上的实验证明了所提方法的有效性。

关键词

引用

@article{arxiv.2111.09852,
  title  = {The Power of Selecting Key Blocks with Local Pre-ranking for Long Document Information Retrieval},
  author = {Minghan Li and Diana Nicoleta Popa and Johan Chagnon and Yagmur Gizem Cinar and Eric Gaussier},
  journal= {arXiv preprint arXiv:2111.09852},
  year   = {2022}
}

备注

34 pages, accepted by ACM Transactions on Information Systems (TOIS)