中文

信息检索中的语言偏见:本质解析及缓解方法

信息检索 2025-09-09 v1 人工智能 计算与语言

摘要

多语言信息检索(MLIR)系统中的语言公平性对于确保不同语言之间获得公平的信息访问至关重要。本文基于查询在不同语言中若语义相同,检索同一 multilingual 文档时应产生等效排序列表这一假设,阐明了该问题的 nature。我们使用传统检索方法以及基于 mBERT 和 XLM-R 的 DPR 神经排序器,对语言公平性进行评估。此外,我们引入了 `LaKDA`,一种用于缓解神经 MLIR 方法中语言偏见的新型损失函数。我们的分析揭示了当前 MLIR 技术中固有的语言偏见,尤其在不同检索方法之间存在显著差异,并证明了 LaKDA 在提升语言公平性方面的有效性。

关键词

引用

@article{arxiv.2509.06195,
  title  = {Language Bias in Information Retrieval: The Nature of the Beast and Mitigation Methods},
  author = {Jinrui Yang and Fan Jiang and Timothy Baldwin},
  journal= {arXiv preprint arXiv:2509.06195},
  year   = {2025}
}

备注

Accepted at EMNLP MRL 2024