中文

注略卷积:统一自注意力表达性与卷积效率

计算机视觉与模式识别 2025-10-24 v1

摘要

自注意力(SA)已成为现代视觉骨干网络的基石,因其对传统卷积(Conv)具有强大的表达能力。然而,其二次复杂度仍是实际应用的关键瓶颈。鉴于卷积具有线性复杂度和强视觉先验,持续努力旨在推动卷积的复兴。然而,仍存在显著的性能鸿沟,表明这些现代化方法尚未捕捉到定义SA的内在表达性。本文重新审视CNN的设计,围绕核心问题展开:哪些原则赋予SA优于卷积的优势?结果我们发现了两项根本性洞见,挑战了先前研究中(如感受野)的长期设计直觉:(1)自适应路由:SA根据语义内容动态调节位置信息的流动,而卷积在所有位置上均使用静态内核。(2)侧抑制:SA在token加权中引发得分竞争,有效抑制冗余并锐化表征,而卷积滤波器缺乏此类抑制动力学,表现出显著冗余。基于此,我们提出了注略卷积(ATConv),一种原则化的卷积算子,其内在注入这些原则。有趣的是,仅使用3×33\times3内核,ATConv在基础视觉任务中持续优于各种SA机制。基于ATConv,我们引入AttNet,一组CNN,可实现仅2700万参数即可达到ImageNet-1K 84.4%的Top-1准确率。在基于扩散的图像生成中,用proposed的3×33\times3 ATConv替换SiT-XL/2中的所有SA,可在40万步中将ImageNet FID降低0.15且加快采样速度。代码地址:https://github.com/price112/Attentive-Convolution

引用

@article{arxiv.2510.20092,
  title  = {Attentive Convolution: Unifying the Expressivity of Self-Attention with Convolutional Efficiency},
  author = {Hao Yu and Haoyu Chen and Yan Jiang and Wei Peng and Zhaodong Sun and Samuel Kaski and Guoying Zhao},
  journal= {arXiv preprint arXiv:2510.20092},
  year   = {2025}
}