中文

跨语言信息检索的进展:基于多语言大语言模型的语言桥接

信息检索 2025-10-02 v1 人工智能 计算与语言

摘要

跨语言信息检索(CLIR)旨在解决检索与原始查询语言不同的语言文档的相关问题。该领域的研究通常将任务框架化为由翻译增强的单语言检索,单独处理检索方法和跨语言能力。单语和跨语检索通常遵循查询扩展、排序、重排序以及越来越多的问答流程。最近的进展则从翻译方法转向嵌入方法,利用多语言大语言模型(LLM),其中对跨语言表示对齐仍是核心挑战。跨语言嵌入和多语言LLM的出现引入了新的范式,提供了更好的检索性能并实现答案生成。本综述提供了从早期翻译方法到最新嵌入驱动和生成技术的全面概述。它呈现了核心CLIR组件、评估实践和可用资源的结构化概述。识别出数据不平衡和语言变异等持久挑战,并提出了推动公平且有效跨语言信息检索的有前景的方向。通过将CLIR置于信息检索和多语言语言处理更广阔的图景中,本工作不仅综述了当前能力,还为构建稳健、包容且可适应的检索系统指明了未来方向。

关键词

引用

@article{arxiv.2510.00908,
  title  = {Bridging Language Gaps: Advances in Cross-Lingual Information Retrieval with Multilingual LLMs},
  author = {Roksana Goworek and Olivia Macmillan-Scott and Eda B. Özyiğit},
  journal= {arXiv preprint arXiv:2510.00908},
  year   = {2025}
}