中文

多模态嵌入模型中的位置偏差:它们偏向开头、中间,还是结尾?

计算机视觉与模式识别 2025-11-17 v1

摘要

位置偏差——即模型无视内容地过度强调特定位置——已被证明会负面影响模型在各种任务中的性能。虽然最近的研究广泛探讨了文本生成模型中的位置偏差,但在表示模型中这种现象的存在和影响仍鲜有探讨。更少人了解多模态模型中的此类偏差。在本工作中,我们研究了多模态表示模型中的位置偏差,具体聚焦于图像-文本检索情境。我们首先区分了 context importance 与位置偏差,然后评估了不同模型和数据集中的位置偏差的存在程度和范围。我们的实验表明,位置偏差在多模态模型中十分常见,但在不同模态间表现不同:文本编码器倾向于偏向输入的开头,而图像编码器则在开头和结尾都显示出偏差。此外,我们发现这种偏差可能源于,或被放大,包括位置编码方案、训练损失、context importance 以及使用图像-文本对进行多模态训练的本质。

关键词

引用

@article{arxiv.2511.11216,
  title  = {Positional Bias in Multimodal Embedding Models: Do They Favor the Beginning, the Middle, or the End?},
  author = {Kebin Wu and Fatima Albreiki},
  journal= {arXiv preprint arXiv:2511.11216},
  year   = {2025}
}

备注

accepted to AAAI 2026 main track