中文

为何要关注万物?聚焦是关键

计算与语言 2026-04-30 v2 人工智能

摘要

标准注意力机制随序列长度呈二次增长。高效注意力方法降低O(n^2)的计算成本,但当 retrofitted 到预训练模型时,往往会降低困惑度、下游准确率或两者兼顾。我们提出了Focus方法,通过学习哪些token对才重要来实现此目标。Focus 添加一小组可学习的质心——每层仅需148K参数——作为门控:只有属于相同质心组的token对在长程范围内相互注意。Focus 可组合:可通过仅训练质心而保持所有原始权重冻结的方式,将其添加到任何预训练模型。实验表明,将Focus 添加到预训练模型后,在从1.24亿到700亿参数的模型规模以及五种注意力架构上,下游基准测试均无退化。意外的是,稀疏Focus注意力在1.24亿规模时(30.3 vs. 31.4困惑度)就超过了完整注意力,在7B规模时(13.82 vs. 13.89困惑度)训练从头开始时,Focus注意力也能匹配完整注意力。Focus 也很快:基于top-k组成员资格可实现2倍加速且质量更好于原始预训练模型。使用我们的FlashAttention分解,Focus在100万token时实现8.6倍加速且无需自定义内核。

关键词

引用

@article{arxiv.2604.03260,
  title  = {Why Attend to Everything? Focus is the Key},
  author = {Hengshuai Yao and Xing Chen and Ahmed Murtadha and Jin Li and Yasin Abbasi Yadkori and Shuai Shao and Changling Liu and Guan Wang and Mingli Yuan and William Chen and Sen Song},
  journal= {arXiv preprint arXiv:2604.03260},
  year   = {2026}
}