即插即用:用于增强微型视觉Transformer的通道混洗模块
计算机视觉与模式识别
2023-10-10 v1 人工智能
摘要
视觉Transformer(ViTs)已在各种计算机视觉任务中展现出卓越性能。然而,高计算复杂度阻碍了ViTs在内存与计算资源受限设备上的适用性。尽管某些研究已深入探讨将卷积层与自注意力机制融合以提升ViTs效率,但在仅基于自注意力机制构建微小且高效的ViTs方面仍存在知识空白。此外,在大型但性能优越的ViT中直接减少特征通道的策略虽提升效率,却常导致显著的性能下降。为应对这些挑战,我们提出一种新颖的通道混洗模块以改进微型ViTs,展示了纯自注意力模型在受限计算资源环境中的潜力。受ShuffleNetV2 \cite{ma2018shufflenet}中通道混洗设计启发,我们的模块扩展微型ViT的特征通道并将通道划分为两组:\textit{Attended}(被关注)组与\textit{Idle}(空闲)组。自注意力计算专用于指定的\textit{Attended}组,随后进行通道混洗操作以促进两组间的信息交换。通过将我们的模块嵌入微型ViT,可在保持与原始模型相当计算复杂度的同时实现更优性能。具体而言,我们所提通道混洗模块在各种微型ViT模型上于ImageNet-1K数据集上持续提升top-1准确率至多2.8%,而模型复杂度变化小于0.03 GMACs。
引用
@article{arxiv.2310.05642,
title = {Plug n' Play: Channel Shuffle Module for Enhancing Tiny Vision Transformers},
author = {Xuwei Xu and Sen Wang and Yudong Chen and Jiajun Liu},
journal= {arXiv preprint arXiv:2310.05642},
year = {2023}
}