基于生成式伪标签的无监督多语言稠密检索
计算与语言
2024-03-07 v1 信息检索
摘要
稠密检索方法在多语言信息检索中展现出良好的性能,其中查询和文档可以使用不同的语言。然而,稠密检索器通常需要大量的配对数据,这在多语言场景下构成了更大的挑战。本文介绍了 UMR,一种无需任何配对数据训练的无监督多语言稠密检索器(Unsupervised Multilingual dense Retriever)。我们的方法利用多语言语言模型的序列似然估计能力,获取用于训练稠密检索器的伪标签。我们提出了一个两阶段框架,以迭代提升多语言稠密检索器的性能。在两个基准数据集上的实验结果表明,UMR 优于有监督基线,展示了无需配对数据训练多语言检索器的潜力,从而增强了其实用性。我们的源代码、数据和模型已在 https://github.com/MiuLab/UMR 公开。
引用
@article{arxiv.2403.03516,
title = {Unsupervised Multilingual Dense Retrieval via Generative Pseudo Labeling},
author = {Chao-Wei Huang and Chen-An Li and Tsu-Yuan Hsu and Chen-Yu Hsu and Yun-Nung Chen},
journal= {arXiv preprint arXiv:2403.03516},
year = {2024}
}
备注
Accepted to Findings of EACL 2024