中文

ReViT:利用注意力残差连接增强 Vision Transformer 的特征多样性

计算机视觉与模式识别 2024-08-06 v2

摘要

Vision Transformer (ViT) 的自注意力机制的特征在于深层存在特征坍塌,导致低级视觉特征消失。然而,此类特征有助于准确表示和识别图像中的元素,并提高基于视觉的识别系统的准确性和鲁棒性。遵循这一原理,我们提出了一种新颖的残差注意力学习方法,用于改进基于 ViT 的架构,增加其视觉特征多样性和模型鲁棒性。通过这种方式,所提出的网络能够捕获并保留重要的低级特征,提供有关被分析场景中元素的更多细节。我们在五个图像分类基准(包括 ImageNet1k、CIFAR10、CIFAR100、Oxford Flowers-102 和 Oxford-IIIT Pet)上评估了所提方法的有效性和鲁棒性,实现了性能提升。此外,在 COCO2017 数据集上的实验表明,当将该方法实施到空间感知 Transformer 模型中时,它能够发现并整合用于目标检测和实例分割的语义和空间关系。

关键词

引用

@article{arxiv.2402.11301,
  title  = {ReViT: Enhancing Vision Transformers Feature Diversity with Attention Residual Connections},
  author = {Anxhelo Diko and Danilo Avola and Marco Cascio and Luigi Cinque},
  journal= {arXiv preprint arXiv:2402.11301},
  year   = {2024}
}

备注

17 pages, single column, 9 figures