中文

改进韩英跨语言检索:语言构成与模型融合的数据中心研究

信息检索 2026-05-20 v2

摘要

随着多语言文本信息的日益增长,跨语言信息检索(CLIR)已成为关键研究领域。然而,训练数据构成对 CLIR 与单语言信息检索(IR)性能的影响尚未得到充分探讨。为系统性地考察这一数据中心问题,本文构建了语言平行的韩英数据集,并训练了不同语言组合的检索模型。实验结果表明,训练数据的语言构成对 IR 性能具有显著影响,呈现出重要的跨语言相关性:CLIR 性能随特定语言配对而提升,而单语言 IR 性能则下降。我们的工作表明,模型融合(Model Merging)可有效缓解这一权衡,既实现强大的 CLIR 效果,又保持单语言 IR 能力。我们的发现凸显了训练数据的语言配置对 CLIR 与单语言 IR 的影响,并将模型融合作为优化这两类任务性能的可行策略呈现出来。

关键词

引用

@article{arxiv.2507.08480,
  title  = {Improving Korean-English Cross-Lingual Retrieval: A Data-Centric Study of Language Composition and Model Merging},
  author = {Youngjoon Jang and Junyoung Son and Taemin Lee and Seongtae Hong and Hyeonseok Moon and Seungyoon Lee and Andrew Matteson and Heuiseok Lim},
  journal= {arXiv preprint arXiv:2507.08480},
  year   = {2026}
}

备注

ACL 2026 MeLLM Workshop