中文

CharacterBERT 与自教学以提升稠密检索器在含错字查询上的鲁棒性

信息检索 2022-04-27 v2 计算与语言

摘要

当前稠密检索器对域外和离群查询缺乏鲁棒性,即它们在这些查询上的效果远差于预期。本文考虑此类查询的一个具体实例:含错字的查询。我们表明,查询中微小的字符级扰动(由错字引起)会极大影响稠密检索器的效果。进而我们论证其根源在于 BERT 所采用的输入分词策略。在 BERT 中,分词使用 BERT 的 WordPiece 分词器完成,我们表明含错字的词元将显著改变分词后所得词元分布。这一分布变化转化为传入稠密检索器基于 BERT 的查询编码器的输入嵌入的变化。随后我们致力于设计对含错字查询鲁棒、同时在无错字查询上仍与先前方法同样高效的稠密检索器方法。为此,我们使用 CharacterBERT 作为主干编码器,并采用一种高效且有效的训练方法,称为自教学(ST),将无错字查询的知识蒸馏到含错字查询中。实验结果表明,CharacterBERT 结合 ST 在含错字查询上相较先前方法取得了显著更高的效果。除这些结果及方法的开源实现外,我们还提供了一个由真实世界含错字查询及在 MS MARCO 语料上的相关相关性判定组成的新段落检索数据集,从而支持研究界对高效且鲁棒的稠密检索器的探究。代码、实验结果和数据集发布于 https://github.com/ielab/CharacterBERT-DR。

关键词

引用

@article{arxiv.2204.00716,
  title  = {CharacterBERT and Self-Teaching for Improving the Robustness of Dense Retrievers on Queries with Typos},
  author = {Shengyao Zhuang and Guido Zuccon},
  journal= {arXiv preprint arXiv:2204.00716},
  year   = {2022}
}

备注

9 pages full paper, accepted at SIGIR2022