TransXNet:使用双动态令牌混合器学习全局与局部动态以实现视觉识别
计算机视觉与模式识别
2025-04-28 v4
摘要
近期研究将卷积整合进 transformer 以引入归纳偏置并提升泛化性能。然而,传统卷积的静态特性使其无法动态适应输入变化,导致卷积与自注意力之间的表示差异,因为后者动态计算注意力图。此外,当堆叠由卷积与自注意力构成的令牌混合器以形成深度网络时,卷积的静态特性阻碍了将先前自注意力生成的特征融合进卷积核。这两大局限导致整个网络的表示能力次优。为寻求解决方案,我们提出轻量级的双动态令牌混合器(D-Mixer),通过计算得到输入依赖的全局与局部聚合权重,同时学习全局与局部动态。D-Mixer 将高效全局注意力模块与输入依赖的深度可分离卷积分别应用于均匀切分的特征段,赋予网络强归纳偏置与扩大的感受野。我们以 D-Mixer 为基本构建块设计了 TransXNet——一种新颖的混合 CNN-Transformer 视觉骨干网络,具有引人注目的性能。在 ImageNet-1K 分类中,TransXNet-T 以 top-1 准确率超越 Swin-T 0.3%,而计算成本不到其一半。此外,TransXNet-S 与 TransXNet-B 展现出优异的模型可扩展性,分别以合理的计算成本达到 83.8% 与 84.6% 的 top-1 准确率。另外,我们提出的网络架构在各种密集预测任务中展现出强泛化能力,在以更低计算成本的同时优于其他最先进(SOTA)网络。代码已公开于 https://github.com/LMMMEng/TransXNet。
引用
@article{arxiv.2310.19380,
title = {TransXNet: Learning Both Global and Local Dynamics with a Dual Dynamic Token Mixer for Visual Recognition},
author = {Meng Lou and Shu Zhang and Hong-Yu Zhou and Sibei Yang and Chuan Wu and Yizhou Yu},
journal= {arXiv preprint arXiv:2310.19380},
year = {2025}
}
备注
Accepted by IEEE TNNLS