基于稠密检索的跨语言训练用于文档检索
计算与语言
2021-09-06 v1 信息检索
摘要
稠密检索(dense retrieval)在英语段落排序中取得了巨大成功。然而,由于训练资源的限制,其在非英语语言文档检索中的有效性仍未被探索。在这项工作中,我们探索了从英语标注向多种非英语语言进行文档排序的不同迁移技术。我们在来自不同语系的六种语言(中文、阿拉伯语、法语、印地语、孟加拉语、西班牙语)的测试集上的实验表明,使用 mBERT 的零样本基于模型的迁移改善了非英语单语检索中的搜索质量。此外,我们发现弱监督目标语言迁移取得了与基于生成的目标语言迁移相竞争的性能,而后者需要外部翻译器和查询生成器。
引用
@article{arxiv.2109.01628,
title = {Cross-Lingual Training with Dense Retrieval for Document Retrieval},
author = {Peng Shi and Rui Zhang and He Bai and Jimmy Lin},
journal= {arXiv preprint arXiv:2109.01628},
year = {2021}
}