单语、跨语和多语信息检索的协同优化方法
信息检索
2024-08-21 v1 计算与语言
摘要
信息检索跨越不同语言正日益成为自然语言处理中的重要挑战。近期基于多语言预训练语言模型的方法取得了显著成功,但常常在牺牲其他性能的代价下仅优化单语、跨语或多语检索性能。本文提出了一种新颖的混合小批量训练策略,以同时提升单语、跨语和多语情境下的零样本检索性能,同时减轻语言偏差。该方法通过基于数据集大小对单语和跨语问答对小批量进行混合采样,微调多语言语言模型。在 XQuAD-R、MLQA-R 和 MIRACL 基准数据集上的实验表明,所提方法在各种语言和检索任务上的零样本检索性能,无论是与仅单语训练还是仅跨语训练相比,都能持续实现相当或更好的结果。混合小批量训练还显著减少了多语言检索中的语言偏差。这些结果表明了该方法对于学习语言无关表示、实现跨多语言强大零样本检索性能的有效性。
关键词
引用
@article{arxiv.2408.10536,
title = {Synergistic Approach for Simultaneous Optimization of Monolingual, Cross-lingual, and Multilingual Information Retrieval},
author = {Adel Elmahdy and Sheng-Chieh Lin and Amin Ahmad},
journal= {arXiv preprint arXiv:2408.10536},
year = {2024}
}
备注
15 pages, 2 figures, 13 tables