增强多语言 RAG 系统的无偏好语言引导查询融合
计算与语言
2026-04-14 v3
摘要
多语言检索增强生成 (mRAG) 系统常表现出对高资源语言(尤其是英语)的偏好,导致广泛采用英语中转。虽然先前研究将这种优势归因于大型语言模型 (LLM) 的英语中心能力,但我们发现,这些测量受到评估基准中固有结构性偏差的显著扭曲。具体而言,我们识别出暴露偏差和黄金可用性先验——这两种偏差均由英语资源分布不均所致——以及源于主题局部性的文化先验,作为影响准确评估真实语言偏好的因素。为解决这些偏差,我们提出了 DeLP(Debiased Language Preference,无偏好语言偏好),一个校准度量,旨在显式消除这些结构性混淆因素。我们使用 DeLP 进行分析,发现此前报告的英语偏好很大程度上是证据分布的副产品,而非模型固有的偏差。相反,我们发现检索器根本上偏好查询语言与文档语言的单语对齐。基于这一洞察,我们引入了 DELTA(DEbiased Language preference-guided Text Augmentation,无偏好语言偏好引导文本增强),一个轻量且高效的 mRAG 框架,战略性地利用单语对齐来优化跨语言检索和生成。实验结果表明,DELTA 在 diverse languages across 领域 consistently 超越了英语中转和 mRAG 基线方法。
引用
@article{arxiv.2601.02956,
title = {Enhancing Multilingual RAG Systems with Debiased Language Preference-Guided Query Fusion},
author = {Jeonghyun Park and Byeongjeong Kim and Seojin Hwang and Hwanhee Lee},
journal= {arXiv preprint arXiv:2601.02956},
year = {2026}
}
备注
ACL 2026 Findings