中文

利用零样本语言相似性迁移提高低资源检索效果

信息检索 2025-03-31 v1

摘要

全球化和殖民化导致世界大多数人仅使用英语和法语等少数语言进行交流,排除了许多其他语言。这严重影响了许多现被视为脆弱或濒危语言(如 Occitan 和 Sicilian)的生存率。这些语言常与其他高资源语言(如法语或意大利语)在语法和词汇方面存在某些相似性。它们可聚类为不同程度互通性的语言变体群体。当前检索系统通常不训练于这些低资源变体之一,导致检索用户只能使用高资源语言表达需求。当大部分信息内容以高资源语言表达时,这一问题更为复杂,进一步阻碍了低资源语言的检索。我们指出,当前检索系统在语言变体之间鲁棒性差,严重影响检索效果。因此,有望这些系统利用神经模型的能力来弥合这些变体之间的差异。这允许用户以其所属的低资源变体表达需求,检索最相关的高资源语言文档。为此,我们提出在语言变体对上进行神经排序器的微调,以此让模型暴露于这些变体的语言相似性。我们发现,这一方法提高了模型直接训练的变体性能,进而正则化这些模型以更好地泛化和在未见的语言变体对上表现更佳。我们还探讨了该方法是否能跨语言族传递,观察结果呈现出异构性,为未来研究开辟了可能之门。

关键词

引用

@article{arxiv.2503.22508,
  title  = {Improving Low-Resource Retrieval Effectiveness using Zero-Shot Linguistic Similarity Transfer},
  author = {Andreas Chari and Sean MacAvaney and Iadh Ounis},
  journal= {arXiv preprint arXiv:2503.22508},
  year   = {2025}
}

备注

12 Pages, 5 Figures, 2 Tables, Full Paper accepted at IR4GOOD track in ECIR 2025