面向鲁棒稠密检索的容错词预训练瓶颈方法
信息检索
2023-11-28 v2
摘要
当前的稠密检索器(DRs)在处理错拼查询时能力有限,而错拼查询在商业搜索引擎的查询流量中占很大比例。主要问题在于DRs所使用的基于预训练语言模型的编码器通常在干净、精心整理的文本数据上训练和微调。错拼查询通常不存在于这些模型的训练数据中,因此在推理时观察到的错拼查询相对于训练和微调所用数据而言是分布外(out-of-distribution)的。先前解决该问题的努力集中于微调策略,但其在错拼查询上的效果仍低于采用独立最先进拼写检查组件的流水线。为应对这一挑战,我们提出ToRoDer(TypOs-aware bottlenecked pre-training for RObust DEnse Retrieval,面向鲁棒稠密检索的容错词感知瓶颈预训练),一种针对DRs的重新训练策略,可在保持下游检索任务有效性的同时增强其对错拼查询的鲁棒性。ToRoDer采用编码器-解码器架构,其中编码器以带掩码标记的错拼文本为输入,并向解码器输出瓶颈信息。解码器随后以瓶颈嵌入以及原始文本中错拼标记被掩去的词嵌入为输入。预训练任务是为编码器和解码器恢复被掩标记。我们广泛的实验结果和详细的消融研究表明,经ToRoDer预训练的DRs在错拼查询上表现出显著更高的有效性,合理地缩小了与使用独立复杂拼写检查组件流水线之间的差距,同时保留了其在正确拼写查询上的有效性。
引用
@article{arxiv.2304.08138,
title = {Typos-aware Bottlenecked Pre-Training for Robust Dense Retrieval},
author = {Shengyao Zhuang and Linjun Shou and Jian Pei and Ming Gong and Houxing Ren and Guido Zuccon and Daxin Jiang},
journal= {arXiv preprint arXiv:2304.08138},
year = {2023}
}
备注
10 pages, accepted at SIGIR-AP