中文

正位于中间:校准位置注意力偏置以提高长上下文利用

计算与语言 2024-07-04 v2 人工智能 机器学习

摘要

即使是专为处理长输入上下文而训练的大型语言模型(LLMs),也难以捕获位于输入中间的相关信息。这一现象被称为 lost-in-the-middle 问题。本文作出三项贡献。首先,我们努力理解导致这一现象的因素,并建立了 lost-in-the-middle 与 LLMs 内在注意力偏置之间的联系:LLMs 表现出一种 U 形注意力偏置,无论其相关性如何,输入开头和末尾的 token 接收更高的注意力。其次,我们通过一种校准机制(found-in-the-middle)来缓解这种位置偏置,使模型能够根据相关性忠实地注意力上下文,即使它们位于中间。第三,我们表明 found-in-the-middle 不仅在定位长上下文中的相关信息方面取得更好性能,而且最终还导致在各种任务上的检索增强生成(RAG)性能提升,甚至在多个基准方法上实现最高提升约 15 个百分点。这些发现为理解 LLM 注意力偏置及其潜在后果开辟了未来方向。

关键词

引用

@article{arxiv.2406.16008,
  title  = {Found in the Middle: Calibrating Positional Attention Bias Improves Long Context Utilization},
  author = {Cheng-Yu Hsieh and Yung-Sung Chuang and Chun-Liang Li and Zifeng Wang and Long T. Le and Abhishek Kumar and James Glass and Alexander Ratner and Chen-Yu Lee and Ranjay Krishna and Tomas Pfister},
  journal= {arXiv preprint arXiv:2406.16008},
  year   = {2024}
}

备注

ACL Findings 2024