中文

长文档嵌入中的信息表示公平性:位置偏差与语言偏差的特殊交互

计算与语言 2026-04-21 v2 人工智能

摘要

为了在基于嵌入的搜索过程中被发现,文档的每个部分都应在其嵌入表示中得到反映。为了量化任何潜在的表示偏差,我们引入了一个基于排列的评估框架。通过该框架,我们观察到,当文档较长且由多个片段组成时,最先进的嵌入模型会表现出系统性的位置偏差和语言偏差。具体来说,早期片段和英语等高资源语言的片段被过度表示,而后期片段和低资源语言的片段则被边缘化。在我们的进一步分析中,我们发现位置偏差源于池化令牌嵌入中前载的注意力分布,即早期令牌获得更多注意力。为了缓解这个问题,我们引入了一种推理时的注意力校准方法,该方法更均匀地重新分配文档位置上的注意力,从而提高了后期片段的可发现性。我们的评估框架和注意力校准可在 https://github.com/impresso/fair-sentence-transformers 获取。

关键词

引用

@article{arxiv.2601.16934,
  title  = {Information Representation Fairness in Long-Document Embeddings: The Peculiar Interaction of Positional and Language Bias},
  author = {Elias Schuhmacher and Andrianos Michail and Juri Opitz and Rico Sennrich and Simon Clematide},
  journal= {arXiv preprint arXiv:2601.16934},
  year   = {2026}
}

备注

To appear in ACL2026 (findings)