量化文本嵌入模型中的位置偏差
计算与语言
2026-01-01 v4 人工智能
信息检索
摘要
嵌入模型是信息检索(IR)和语义相似度测量中至关重要的工具,但其对较长文本及相关位置偏差的处理尚未得到充分探讨。本研究检验了内容位置和输入大小对文本嵌入的影响。我们的实验表明,无论嵌入模型是否包含位置编码机制,都会过度关注输入开头的部分。消融研究显示,在文档开头插入无关文本或删除文本,会比在文档末尾的消融操作导致嵌入余弦相似度下降最多12.3%。回归分析进一步确认了这一偏差,随着位置远离开头的增长,即使内容本身无关,也会导致句子重要性下降。我们推测,这一效应源于预处理策略和所选的位置编码技术。这些发现量化了检索系统的敏感性,并为嵌入模型的鲁棒性提供了新视角。
引用
@article{arxiv.2412.15241,
title = {Quantifying Positional Biases in Text Embedding Models},
author = {Reagan J. Lee and Samarth Goel and Kannan Ramchandran},
journal= {arXiv preprint arXiv:2412.15241},
year = {2026}
}
备注
13 pages, 11 figures, NeurIPS