LaPraDoR:用于零样本文本检索的无监督预训练稠密检索器
计算与语言
2022-04-28 v2 人工智能
信息检索
机器学习
摘要
在本文中,我们提出 LaPraDoR,一种无需任何监督数据训练的预训练双塔稠密检索器。具体而言,我们首先提出迭代对比学习(ICoL),利用缓存机制迭代训练查询编码器与文档编码器。ICoL 不仅增加了负例数量,还使缓存样本的表示保持在相同的隐空间中。我们随后提出词典增强稠密检索(LEDR),作为一种简单而有效的方式,以词汇匹配增强稠密检索。我们在近期提出的 BEIR 基准上评估 LaPraDoR,该基准包含 9 类零样本文本检索任务的 18 个数据集。实验结果表明,与有监督稠密检索模型相比,LaPraDoR 达到了最先进的性能,进一步分析揭示了我们训练策略与目标的有效性。与重排序相比,我们的词典增强方法可在毫秒内运行(快 22.5 倍),同时取得更优性能。
引用
@article{arxiv.2203.06169,
title = {LaPraDoR: Unsupervised Pretrained Dense Retriever for Zero-Shot Text Retrieval},
author = {Canwen Xu and Daya Guo and Nan Duan and Julian McAuley},
journal= {arXiv preprint arXiv:2203.06169},
year = {2022}
}
备注
ACL 2022 (Findings)