通过对比跨度预测预训练判别性文本编码器用于稠密检索
信息检索
2022-04-25 v1
摘要
稠密检索已在许多信息检索(IR)相关任务中展现出有前景的结果,其基础是面向有效搜索的高质量文本表示学习。近期一些研究表明,基于自编码器的语言模型能够利用弱解码器提升稠密检索性能。然而,我们认为 1) 解码所有输入文本并不具备判别性,且 2) 即便是弱解码器也会对编码器产生旁路效应。因此,本工作中我们引入一种新颖的对比跨度预测任务来单独预训练编码器,同时仍保留自编码器的瓶颈能力。核心思想是借助分组对比损失,迫使编码器生成接近于其自身随机跨度的文本表示,而远离其他跨度。如此,我们可 1) 通过跨度的分组对比学习高效学习判别性文本表示,且 2) 彻底避免解码器的旁路效应。在公开检索基准数据集上的综合实验表明,我们的方法可显著优于现有的稠密检索预训练方法。
引用
@article{arxiv.2204.10641,
title = {Pre-train a Discriminative Text Encoder for Dense Retrieval via Contrastive Span Prediction},
author = {Xinyu Ma and Jiafeng Guo and Ruqing Zhang and Yixing Fan and Xueqi Cheng},
journal= {arXiv preprint arXiv:2204.10641},
year = {2022}
}
备注
Accepted to SIGIR 2022