注意力盆地:大型语言模型中上下文位置的重要性
计算与语言
2025-08-08 v1 人工智能
摘要
大型语言模型(LLM)的性能对输入中信息的上下文位置高度敏感。为调查这种位置偏差背后的机制,我们的广泛实验揭示了一个一致现象,称为注意力盆地:当模型面对一序列结构化项目(例如检索到的文档或 few-shot 示例)时,模型系统性地对序列开头和末尾的项目分配更高的注意力,而忽略中间的项目。关键的是,我们的分析进一步表明,将更高注意力分配给关键信息是提升模型性能的关键。基于这些见解,我们引入注意力驱动的重排序(AttnRank),一个两阶段框架:(i)使用小型校准集估计算模型的内在位置注意力偏好,(ii)重新排序检索到的文档或 few-shot 示例,以将最重要内容与这些高注意力位置对齐。AttnRank 是一种模型无关、训练免费且即插即用的方法,计算开销最小。在针对多跳问答和 few-shot 上下文学习任务进行实验后显示,AttnRank 在规模和架构各异的 10 个大型语言模型上实现了显著提升,而无需修改模型参数或训练程序。
引用
@article{arxiv.2508.05128,
title = {Attention Basin: Why Contextual Position Matters in Large Language Models},
author = {Zihao Yi and Delong Zeng and Zhenqing Ling and Haohao Luo and Zhe Xu and Wei Liu and Jian Luan and Wanxia Cao and Ying Shen},
journal= {arXiv preprint arXiv:2508.05128},
year = {2025}
}