关于基于多语言文本编码器的跨语言检索
计算与语言
2021-12-22 v1 信息检索
摘要
在这项工作中,我们提出了一项系统的实证研究,聚焦于最先进的多语言编码器在跨语言文档与句子检索任务中针对若干不同语对的适用性。我们首先将这些模型视为多语言文本编码器,并在无监督即席句子级与文档级跨语言信息检索(CLIR)中对其性能进行基准测试。与有监督语言理解不同,我们的结果表明:对于无监督文档级 CLIR——一种没有用于 IR 特定微调的相关性判断的设置——经预训练的多语言编码器平均未能显著超越基于跨语言词嵌入(CLWEs)的早期模型。对于句子级检索,我们确实取得了最先进的性能:然而,峰值分数由以有监督方式进一步专精于句子理解任务的多语言编码器所达到,而非使用其原始的“开箱即用”变体。继这些结果之后,我们为文档级 CLIR 引入了局部化相关性匹配,即对查询与文档段落独立打分。在第二部分的实验中,我们在一系列零样本语言与领域迁移 CLIR 实验中评估了以有监督方式(即学习排序)在英语相关性数据上微调的多语言编码器。我们的结果表明,有监督重排序极少能改善作为无监督基础排序器的多语言 transformer 的性能。最终,仅通过领域内对比微调(即同领域、仅语言迁移),我们才得以提升排序质量。我们揭示了跨语言检索结果与目标语言中(零样本)跨语言迁移用于单语检索的结果之间存在显著的实证差异,这指向了在单语数据上训练的检索模型的“单语过拟合”。
引用
@article{arxiv.2112.11031,
title = {On Cross-Lingual Retrieval with Multilingual Text Encoders},
author = {Robert Litschko and Ivan Vulić and Simone Paolo Ponzetto and Goran Glavaš},
journal= {arXiv preprint arXiv:2112.11031},
year = {2021}
}
备注
to appear in IRJ ECIR 2021 Special Issue. arXiv admin note: substantial text overlap with arXiv:2101.08370