中文

通过缩放单个维度来缓解大语言模型中的位置偏差

计算机视觉与模式识别 2024-06-05 v1

摘要

大型语言模型(LLMs)因其出色的泛化能力和稳健的生成能力而日益应用于各种实际场景。然而,它们表现出位置偏差,也称为“lost in the middle”,这是一种在长上下文场景中尤其突出的现象,这表明关键信息在提示不同位置的放置会显著影响准确性。这篇论文首先探索了位置偏差的微观表现,得出注意力权重是位置偏差的微观表达。进一步地,除了位置嵌入之外,因果注意力掩码也通过创建位置特定的隐藏状态来贡献位置偏差。基于这些见解,我们提出了通过缩放此位置隐藏状态来缓解位置偏差的方法。在 NaturalQuestions 多文档 QA、KV 检索、LongBench 和时间线重排任务上使用各种模型(包括 RoPE 模型、上下文窗口扩展模型和 Alibi 模型)的实验,显示了该方法的有效性和通用性。我们的方法通过修改隐藏状态的一个维度,可提高性能最高可达 15.2%。我们的代码可在 https://aka.ms/PositionalHidden 获取。

关键词

引用

@article{arxiv.2406.02535,
  title  = {Enhancing 2D Representation Learning with a 3D Prior},
  author = {Mehmet Aygün and Prithviraj Dhar and Zhicheng Yan and Oisin Mac Aodha and Rakesh Ranjan},
  journal= {arXiv preprint arXiv:2406.02535},
  year   = {2024}
}