通过缩放单个维度来缓解大语言模型中的位置偏差
计算机视觉与模式识别
2024-06-05 v1
摘要
大型语言模型(LLMs)因其出色的泛化能力和稳健的生成能力而日益应用于各种实际场景。然而,它们表现出位置偏差,也称为“lost in the middle”,这是一种在长上下文场景中尤其突出的现象,这表明关键信息在提示不同位置的放置会显著影响准确性。这篇论文首先探索了位置偏差的微观表现,得出注意力权重是位置偏差的微观表达。进一步地,除了位置嵌入之外,因果注意力掩码也通过创建位置特定的隐藏状态来贡献位置偏差。基于这些见解,我们提出了通过缩放此位置隐藏状态来缓解位置偏差的方法。在 NaturalQuestions 多文档 QA、KV 检索、LongBench 和时间线重排任务上使用各种模型(包括 RoPE 模型、上下文窗口扩展模型和 Alibi 模型)的实验,显示了该方法的有效性和通用性。我们的方法通过修改隐藏状态的一个维度,可提高性能最高可达 15.2%。我们的代码可在 https://aka.ms/PositionalHidden 获取。
引用
@article{arxiv.2406.02535,
title = {Enhancing 2D Representation Learning with a 3D Prior},
author = {Mehmet Aygün and Prithviraj Dhar and Zhicheng Yan and Oisin Mac Aodha and Rakesh Ranjan},
journal= {arXiv preprint arXiv:2406.02535},
year = {2024}
}