基于局部预排序选取关键块的长文档信息检索能力
信息检索
2022-10-18 v3
摘要
在广泛的自然语言处理与信息检索任务中,基于Transformer的模型,特别是如BERT之类的预训练语言模型,已展现出巨大的有效性。然而,由于自注意力机制的二次复杂度,此类模型难以处理长文档。处理该问题的近期工作包括截断长文档(会丢失潜在相关信息)、将文档分割为多个段落(当段落数较大时可能导致信息遗漏和高计算复杂度),或修改自注意力机制使其如稀疏注意力模型般更稀疏(同样面临遗漏信息的风险)。我们在此遵循一种略有不同的方法:首先通过局部查询-块预排序选取长文档的关键块,然后将少量块聚合形成可由BERT等模型处理的短文档。在标准信息检索数据集上的实验证明了所提方法的有效性。
引用
@article{arxiv.2111.09852,
title = {The Power of Selecting Key Blocks with Local Pre-ranking for Long Document Information Retrieval},
author = {Minghan Li and Diana Nicoleta Popa and Johan Chagnon and Yagmur Gizem Cinar and Eric Gaussier},
journal= {arXiv preprint arXiv:2111.09852},
year = {2022}
}
备注
34 pages, accepted by ACM Transactions on Information Systems (TOIS)