中文

聚焦注意力:用于选择性可扩展变换器的 Focal Attention

计算与语言 2025-11-11 v1 机器学习

摘要

注意力是变换器架构的核心组件,无论是编码器-only、解码器-only 还是编码器-解码器模型。然而,标准的 softmax 注意力会产生噪声较大的概率分布,可能损害这些模型在每一层有效特征选择的能力,尤其是对于长上下文情境。我们提出了 Focal Attention,这是一种简单而有效的修改,通过控制 softmax 温度(可为固定超参数或训练期间可学习的参数)来锐化注意力分布。这种锐化使模型能够集中注意力于最相关的标记,同时抑制不相关的标记。经验上,Focal Attention 相对于标准变换器在模型规模、训练数据和上下文长度方面更具可扩展性。在 diverse 基准测试中,它以相同准确率实现,最多可减少 42% 的参数或 33% 的训练数据。在长上下文任务上,它实现了从 17% 到 82% 的显著相对改进,展示了在实际应用中有效性。

关键词

引用

@article{arxiv.2511.06818,
  title  = {Learning to Focus: Focal Attention for Selective and Scalable Transformers},
  author = {Dhananjay Ram and Wei Xia and Stefano Soatto},
  journal= {arXiv preprint arXiv:2511.06818},
  year   = {2025}
}