全局学习何时不关注
计算与语言
2025-12-30 v1 人工智能
摘要
在阅读书籍时,人类主要关注当前页面,仅在必要时翻阅回顾先前上下文。类似地,我们展示了大型语言模型(LLM)可以学习动态确定何时关注全局上下文。我们提出全或无注意力(All-or-Here Attention, AHA),该方法利用每个注意力头的二进制路由器,动态在每个标记上在完全注意力和局部滑动窗口注意力之间切换。我们的结果表明,在窗口大小为256个标记时,最高可将原有的完全注意力操作替换为滑动窗口注意力操作而不影响性能。此外,通过评估AHA在各种窗口大小下的表现,我们识别出上下文依赖性呈长尾分布,其中对全局注意力的必要性随局部窗口的扩大而迅速衰减。通过将局部处理与全局访问解耦,AHA揭示了完全注意力实际上是大多数冗余的,有效的推理仅需要按需访问全局上下文。
引用
@article{arxiv.2512.22562,
title = {Learning When Not to Attend Globally},
author = {Xuan Luo and Kailai Zhang and Xifeng Yan},
journal= {arXiv preprint arXiv:2512.22562},
year = {2025}
}