中文

什么驱动跨语言排序?基于多语言语言模型的检索方法

信息检索 2025-11-25 v1 人工智能 计算与语言

摘要

跨语言信息检索(CLIR)使多语言知识获取成为可能,但由于资源差异、书写系统差异以及嵌入模型中跨语言语义对齐薄弱,仍面临挑战。现有流水线通常依赖翻译和单语检索启发式方法,这会增加计算开销和噪声,降低性能。本工作系统评估了四种干预类型——文档翻译、基于预训练编码器的多语言密集检索、词级/短语级/查询-文档级对比学习以及交叉编码器重排序——在三个基准数据集上的表现。我们发现,专门为 CLIR 训练的密集检索模型始终优于词表匹配方法,并且从文档翻译中获益甚微。对比学习缓解了语言偏差,并为初始对齐较弱的编码器带来了显著提升,重排序也可能有效,但取决于交叉编码器训练数据的质量。尽管高资源语言在整体性能上仍占主导地位,但相对于词表匹配和文档翻译基线的提升在低资源和跨书写系统语言对上最为显著。这些发现表明,跨语言搜索系统应优先考虑语义多语言嵌入和基于学习的针对性对齐,而非基于翻译的流水线,尤其是对于跨书写系统和资源不足的语言。

关键词

引用

@article{arxiv.2511.19324,
  title  = {What Drives Cross-lingual Ranking? Retrieval Approaches with Multilingual Language Models},
  author = {Roksana Goworek and Olivia Macmillan-Scott and Eda B. Özyiğit},
  journal= {arXiv preprint arXiv:2511.19324},
  year   = {2025}
}