中文

通过最优传输蒸馏改进低资源语言的跨语言信息检索

计算与语言 2023-01-31 v1 信息检索

摘要

受益于基于 transformer 的预训练语言模型,神经排序模型取得了显著进展。最近,多语言预训练语言模型的出现为设计神经跨语言检索模型提供了有力支持。然而,由于不同语言的预训练数据不平衡,多语言语言模型在许多下游任务中已表现出高资源与低资源语言之间的性能差距。基于此类预训练模型构建的跨语言检索模型会继承语言偏差,导致低资源语言的结果次优。此外,与存在 MS MARCO 等大规模文档排序训练语料的英语到英语检索任务不同,低资源语言跨语言检索数据的缺乏使得训练跨语言检索模型更具挑战性。在本工作中,我们提出 OPTICAL:用于低资源跨语言信息检索的最优传输蒸馏(Optimal Transport distillation for low-resource Cross-lingual information retrieval)。为将模型从高资源语言迁移到低资源语言,OPTICAL 将跨语言词元对齐任务建模为最优传输问题,以从训练良好的单语检索模型中学习。通过将跨语言知识与查询-文档匹配知识分离,OPTICAL 仅需双语语料进行蒸馏训练,这对低资源语言更为可行。实验结果表明,在极少训练数据下,OPTICAL 在低资源语言上显著优于包括神经机器翻译在内的强基线。

关键词

引用

@article{arxiv.2301.12566,
  title  = {Improving Cross-lingual Information Retrieval on Low-Resource Languages via Optimal Transport Distillation},
  author = {Zhiqi Huang and Puxuan Yu and James Allan},
  journal= {arXiv preprint arXiv:2301.12566},
  year   = {2023}
}