中文

LANGSAE EDITING:通过事后语言身份移除改进多语言信息检索

计算与语言 2026-01-09 v1 信息检索

摘要

多语言环境中的稠密检索通常在混合语言集合上进行搜索,然而多语言嵌入在编码语义的同时也编码了语言身份。这种语言信号可能会夸大同语言对之间的相似度,并挤掉用其他语言书写的相关证据。我们提出了 LANGSAE EDITING,这是一种在池化嵌入上训练的事后稀疏自编码器,能够在向量空间中直接可控地移除语言身份信号。该方法利用跨语言激活统计信息识别与语言相关的潜在单元,在推理时抑制这些单元,并在原始维度上重建嵌入,使其与现有向量数据库兼容,而无需重新训练基础编码器或重新编码原始文本。跨多种语言的实验表明,排序质量和跨语言覆盖率均有持续提升,对于文字差异较大的语言提升尤为显著。

关键词

引用

@article{arxiv.2601.04768,
  title  = {LANGSAE EDITING: Improving Multilingual Information Retrieval via Post-hoc Language Identity Removal},
  author = {Dongjun Kim and Jeongho Yoon and Chanjun Park and Heuiseok Lim},
  journal= {arXiv preprint arXiv:2601.04768},
  year   = {2026}
}

备注

16 pages, 3 figures