面向基于BERT的段落检索与排序的错字处理
信息检索
2021-09-14 v2
摘要
段落检索与排序是开放域问答与信息检索中的关键任务。当前有效的方法大多依赖基于预训练深度语言模型的检索器与排序器。这些方法已被证明能有效建模查询与段落之间的语义匹配,即便在存在关键词失配(即与查询相关但不含重要查询关键词的段落)时亦然。本文中我们考察稠密检索器(DR,一种段落检索方法)与BERT重排序器(一种流行的段落重排序方法)。在此背景下,我们正式研究这些模型如何应对并适应一种特定类型的关键词失配——由查询中关键词错字所引发的失配。通过实证调研,我们发现错字可导致检索与排序效果显著下降。随后我们提出一种简单的错字感知训练框架用于DR与BERT重排序器以解决该问题。在MS MARCO段落排序数据集上的实验结果表明,采用我们所提错字感知训练后,DR与BERT重排序器可对查询中的错字变得鲁棒,相较未恰当考虑错字的模型效果显著提升。
引用
@article{arxiv.2108.12139,
title = {Dealing with Typos for BERT-based Passage Retrieval and Ranking},
author = {Shengyao Zhuang and Guido Zuccon},
journal= {arXiv preprint arXiv:2108.12139},
year = {2021}
}
备注
Short paper, accepted at EMNLP2021 main conference