中文

AdaNCA:用于更稳健视觉转换器的自适应神经细胞自动机

计算机视觉与模式识别 2024-11-22 v5

摘要

视觉转换器 (ViT) 通过视觉-标记交互学习在图像分类方面表现突出,尤其在通过区域注意或卷积引入局部信息后更为 effective。尽管此类架构改进了不同粒度的特征聚合,但往往难以为网络的鲁棒性贡献。神经细胞自动机 (NCA) 通过局部交互建模全局视觉-标记表示,其训练策略和架构设计赋予了强大的泛化能力和对噪声输入的鲁棒性。本文提出了用于视觉转换器的自适应神经细胞自动机 (AdaNCA),将 NCA 作为 ViT 层之间的即插即用适配器,从而增强 ViT 在对抗样本以及 out-of-distribution 输入方面的性能和鲁棒性。为克服标准 NCA 的高计算开销,我们提出了动态交互以实现更高效的交互学习。通过对 AdaNCA 放置和鲁棒性改进进行分析,我们还开发了一种算法,用于识别 AdaNCA 最有效的插入点。在参数增加不到 3% 的情况下,AdaNCA 在 ImageNet1K 基准上的对抗攻击准确率提升超过 10%。此外,我们在八个鲁棒性基准和四个 ViT 架构上进行了广泛评估,证明 AdaNCA 作为即插即用模块始终能提高 ViT 的鲁棒性。

关键词

引用

@article{arxiv.2406.08298,
  title  = {AdaNCA: Neural Cellular Automata As Adaptors For More Robust Vision Transformer},
  author = {Yitao Xu and Tong Zhang and Sabine Süsstrunk},
  journal= {arXiv preprint arXiv:2406.08298},
  year   = {2024}
}

备注

32 pages, 12 figures