一种用于学习判别性自编码器以支持稠密检索的对比预训练方法
信息检索
2022-08-23 v1
摘要
稠密检索(DR)在信息检索中已展现出有前景的结果。本质上,DR 需要高质量的文本表示以支持在表示空间中的有效搜索。近期研究表明,带有弱解码器的基于自编码器的预训练语言模型可提供高质量文本表示,提升 DR 模型的效果与少样本能力。然而,即便是弱自回归解码器也会对编码器产生旁路效应。更重要的是,由于解码输入文本时每个词元被同等对待,所学表示的判别能力可能受限。为解决上述问题,本文提出一种对比预训练方法,以学习带有轻量多层感知机(MLP)解码器的判别性自编码器。基本思想是以非自回归方式生成输入文本的词分布,并将同一文本两个掩码版本的词分布拉近,同时推远与其他文本的距离。我们从理论上表明,我们的对比策略能抑制常见词并突出代表性词,从而得到判别性表示。实证结果显示,我们的方法在稠密检索上显著优于最先进的基于自编码器的语言模型及其他预训练模型。
引用
@article{arxiv.2208.09846,
title = {A Contrastive Pre-training Approach to Learn Discriminative Autoencoder for Dense Retrieval},
author = {Xinyu Ma and Ruqing Zhang and Jiafeng Guo and Yixing Fan and Xueqi Cheng},
journal= {arXiv preprint arXiv:2208.09846},
year = {2022}
}
备注
Accepted by CIKM2022