ACC-ViT:空洞卷积在视觉 Transformer 中的回归
计算机视觉与模式识别
2024-03-08 v1
摘要
Transformer 通过受视觉感知启发的注意力机制创新,已提升至最先进的视觉架构。目前,视觉 Transformer 中主要存在两类注意力:区域注意力和稀疏注意力。前者将像素相互作用限制在区域内;后者将其分布在稀疏网格上。它们相反的性质导致了在保持层次关系与获取全局上下文之间的两难困境。在本工作中,受空洞卷积 (atrous convolution) 的启发,我们引入了空洞注意力,这是一种区域注意力和稀疏注意力的融合,能够自适应地整合局部和全局信息,同时保持层次关系。作为对空洞卷积的进一步致敬,我们使用空洞卷积重新设计了普遍存在的倒残差卷积块。最后,我们提出了一种通用的混合视觉 Transformer 主干网络,名为 ACC-ViT,遵循标准视觉任务的常规做法。我们的微型版本模型在 ImageNet-1K 上实现了约 的准确率,参数量少于 百万,相比最先进的 MaxViT 提高了 ,同时参数量减少了 。此外,我们在不同的评估设置下调查了 ACC-ViT 主干网络的有效性,例如在涉及医学图像分析、物体检测和语言 - 图像对比学习的任务上进行微调、线性探测和零样本学习。因此,ACC-ViT 是一个强大的视觉主干网络,在移动端规模版本中也具有竞争力,非常适合具有小数据集的特定应用。
引用
@article{arxiv.2403.04200,
title = {ACC-ViT : Atrous Convolution's Comeback in Vision Transformers},
author = {Nabil Ibtehaz and Ning Yan and Masood Mortazavi and Daisuke Kihara},
journal= {arXiv preprint arXiv:2403.04200},
year = {2024}
}