中文

重新审视视觉骨干网络中卷积与注意力的融合

计算机视觉与模式识别 2024-11-22 v1 人工智能

摘要

卷积(Convs)和多头自注意力(MHSAs)通常被视为构建视觉骨干网络的替代方案。尽管一些工作试图融合两者,但它们是在最精细的像素粒度上同时应用这两种算子。既然卷积已经负责逐像素特征提取,问题在于我们是否还需要在如此细粒度的层面上包含计算量大的多头自注意力。事实上,这是视觉Transformer在输入分辨率方面可扩展性问题的根本原因。为了解决这个重要问题,我们在本文中提出在不同粒度级别上并行使用多头自注意力和卷积。具体来说,在每一层中,我们使用两种不同的方式来表示图像:一个细粒度的规则网格和一个粗粒度的语义槽集合。我们对这两种表示应用不同的操作:对网格应用卷积以提取局部特征,对语义槽应用多头自注意力以提取全局特征。引入了一对完全可微的软聚类和分发模块来桥接网格和集合表示,从而实现局部-全局融合。通过在多种视觉任务上的大量实验,我们实证验证了所提出的融合方案(命名为GLMix)的潜力:通过将细粒度特征的负担卸载给轻量级卷积,仅需在少量(例如64个)语义槽上使用多头自注意力即可匹配最新最先进骨干网络的性能,同时效率更高。我们的可视化结果还表明,仅使用ImageNet-1k分类监督,软聚类模块就能产生有意义的语义分组效果,这可能带来更好的可解释性,并启发新的弱监督语义分割方法。代码将在\url{https://github.com/rayleizhu/GLMix}提供。

关键词

引用

@article{arxiv.2411.14429,
  title  = {Revisiting the Integration of Convolution and Attention for Vision Backbone},
  author = {Lei Zhu and Xinjiang Wang and Wayne Zhang and Rynson W. H. Lau},
  journal= {arXiv preprint arXiv:2411.14429},
  year   = {2024}
}

备注

NeurIPS 2024