中文

跨语言检索中的不对称性由集中性而非各向同性引起

计算与语言 2026-05-27 v1

摘要

多语言嵌入模型被部署在假设跨语言检索是对称的情形下:如果语言A中的查询检索到语言B中的其翻译,反向操作也应成立。但实际并非如此。我们使用包含6518个习语和谚语的平行语料库(英文、孟加拉、 Hindi、阿拉伯语),由五个生产级编码器(Gemini、Mistral、OpenAI-L、OpenAI-S、Qwen)嵌入,我们将此失败形式化为最近邻互惠性不足,测试单一机制性命题:在多语言空间的几何病理问题中,集中性而非各向同性、质心漂移或幅值,是主要的因果驱动因素。通过五项预先登记的实验(指定了可证伪条件),集中质量在联合回归中占主导地位(49.5%的主导份额,1.68倍于下一个预测器;部分R²为0.302,而各向同性的R²仅为0.003),而集中感知的评分校正(CSLS)可缩小最坏到最好的互惠性差距的63.5%,并使模型内在效应大小达到手术式集中向量剔除的130倍。后者对比揭示了机制:集中性是相似度度量的病理现象,而非单个集中向量的病理现象。我们通过表明两种现象在统计上可被分离,解决了已知的各向同性-集中性悖论,并建议将余弦相似度替换为CSLS作为多语言嵌入管道的默认检索度量。

关键词

引用

@article{arxiv.2605.26575,
  title  = {Hubness, Not Anisotropy, Drives Cross-Lingual Retrieval Asymmetry in Multilingual Embedding Models},
  author = {Adib Sakhawat and Fardeen Sadab and Atik Shahriar},
  journal= {arXiv preprint arXiv:2605.26575},
  year   = {2026}
}

备注

17 pages, 5 figures