中文

基于 PLM 的模型中长度诱导的嵌入坍塌

计算与语言 2025-06-11 v2 人工智能 信息检索

摘要

来自基于 PLM 的模型的文本嵌入支持广泛的应用,但它们在处理较长文本时性能往往会下降。在本文中,我们引入了一种我们称之为长度坍塌(Length Collapse)的现象,即较长文本的嵌入倾向于聚类在一起。这种聚类导致短文本和长文本嵌入之间的分布不一致。我们进一步研究了这些差异如何导致在各种下游任务中观察到的长文本性能下降。通过对自注意力机制的严格理论分析——在基于 PLM 的模型中充当低通滤波器——我们证明随着文本长度的增加,低通滤波的强度会增强,导致嵌入保留更多低频分量。因此,输入 token 特征变得更加相似,导致聚类,最终导致较长文本的嵌入坍塌。为了解决这个问题,我们提出了一种简单的方法 TempScale,它缓解了长度坍塌现象。通过缩小长文本和短文本之间低通滤波率的差距,TempScale 确保了不同文本长度之间的一致性嵌入。该方法在 MTEB 上实现了 0.94% 的性能提升,在 LongEmbed 上实现了 1.10% 的提升(LongEmbed 专门关注长上下文检索),为我们的分析的有效性提供了有力证据。源代码可在 https://github.com/Yuqi-Zhou/Length_Collapse 获取。

关键词

引用

@article{arxiv.2410.24200,
  title  = {Length-Induced Embedding Collapse in PLM-based Models},
  author = {Yuqi Zhou and Sunhao Dai and Zhanshuo Cao and Xiao Zhang and Jun Xu},
  journal= {arXiv preprint arXiv:2410.24200},
  year   = {2025}
}

备注

Accepted by ACL 2025