中文

面向可解释高效注意力:通过压缩以合同实现全体注意力的压缩

机器学习 2025-11-06 v3 计算机视觉与模式识别

摘要

注意力机制在多个领域取得了显著的经验成功,但其底层优化目标仍不明确。此外,自注意力的二次复杂度正变得日益不可接受。尽管可解释性与高效性是两个相互强化的目标,但以往工作通常分别关注这两个方面。本文提出一种统一的优化目标,通过算法展开派生出内在可解释且高效的注意力机制。准确地说,我们构建该目标的一个梯度步骤,包含我们提出的 \emph{Contract-and-Broadcast Self-Attention} (CBSA) 的一组前向操作,通过将输入 token 向低维结构压缩以代表性为中心来实现压缩。这种新型机制不仅能通过固定代表性数量实现线性规模,还能在使用不同代表性集合时涵盖各种注意力机制的实现。我们进行大量实验,证明其在视觉任务上实现了相当的性能,并在黑盒注意力机制方面展现出优势。我们的工作为注意力机制的可解释性与高效性集成以及统一公式提供了启发。

关键词

引用

@article{arxiv.2509.16875,
  title  = {Towards Interpretable and Efficient Attention: Compressing All by Contracting a Few},
  author = {Qishuai Wen and Zhiyuan Huang and Chun-Guang Li},
  journal= {arXiv preprint arXiv:2509.16875},
  year   = {2025}
}

备注

NeurIPS2025 Spotlight; Code is available at https://github.com/QishuaiWen/CBSA