基于对比学习的无监督稠密信息检索
信息检索
2022-08-30 v4 人工智能
计算与语言
摘要
近年来,信息检索领域出现了基于神经网络的稠密检索器,作为基于词频的经典稀疏方法的替代。这些模型在拥有大量训练集的数据集和任务上取得了 SOTA 结果。然而,它们在迁移至没有训练数据的新应用时表现不佳,且被如 BM25 等无监督词频方法所超越。在本工作中,我们探索了将对比学习作为训练无监督稠密检索器的方法的局限性,并表明它在各种检索设置下均能带来强劲的性能。在 BEIR 基准上,我们的无监督模型在 15 个数据集中的 11 个上的 Recall@100 指标优于 BM25。当作为微调前的预训练使用时,无论是在几千个领域内样本上还是在大型 MS MARCO 数据集上,我们的对比模型都在 BEIR 基准上带来了提升。最后,我们评估了我们的方法在多语言检索中的表现,其中训练数据比英语更为稀缺,并表明我们的方法实现了强大的无监督性能。当仅在监督英语数据上微调并在斯瓦希里语等低资源语言上评估时,我们的模型也展现出强大的跨语言迁移能力。我们表明,我们的无监督模型能够在不同书写系统之间执行跨语言检索,例如从阿拉伯语查询检索英文文档,这是词匹配方法无法做到的。
引用
@article{arxiv.2112.09118,
title = {Unsupervised Dense Information Retrieval with Contrastive Learning},
author = {Gautier Izacard and Mathilde Caron and Lucas Hosseini and Sebastian Riedel and Piotr Bojanowski and Armand Joulin and Edouard Grave},
journal= {arXiv preprint arXiv:2112.09118},
year = {2022}
}