中文

LaPraDoR:用于零样本文本检索的无监督预训练稠密检索器

计算与语言 2022-04-28 v2 人工智能 信息检索 机器学习

摘要

在本文中,我们提出 LaPraDoR,一种无需任何监督数据训练的预训练双塔稠密检索器。具体而言,我们首先提出迭代对比学习(ICoL),利用缓存机制迭代训练查询编码器与文档编码器。ICoL 不仅增加了负例数量,还使缓存样本的表示保持在相同的隐空间中。我们随后提出词典增强稠密检索(LEDR),作为一种简单而有效的方式,以词汇匹配增强稠密检索。我们在近期提出的 BEIR 基准上评估 LaPraDoR,该基准包含 9 类零样本文本检索任务的 18 个数据集。实验结果表明,与有监督稠密检索模型相比,LaPraDoR 达到了最先进的性能,进一步分析揭示了我们训练策略与目标的有效性。与重排序相比,我们的词典增强方法可在毫秒内运行(快 22.5 倍),同时取得更优性能。

关键词

引用

@article{arxiv.2203.06169,
  title  = {LaPraDoR: Unsupervised Pretrained Dense Retriever for Zero-Shot Text Retrieval},
  author = {Canwen Xu and Daya Guo and Nan Duan and Julian McAuley},
  journal= {arXiv preprint arXiv:2203.06169},
  year   = {2022}
}

备注

ACL 2022 (Findings)