多属性视觉 Transformer 是高效且鲁棒的学习器
计算机视觉与模式识别
2024-07-22 v2
摘要
自诞生以来,视觉 Transformer (ViTs) 已成为卷积神经网络 (CNNs) 在广泛任务中的有力替代方案。ViTs 表现出显著的特性,包括全局注意力、对遮挡的弹性以及对分布偏移的适应性。ViTs 一个尚未充分探索的方面是其多属性学习的潜力,即同时掌握多个属性相关任务的能力。在本文中,我们深入研究了 ViTs 的多属性学习能力,提出了一种简单而有效的策略,通过单个 ViT 网络将各种属性作为不同任务进行训练。我们评估了多属性 ViTs 对抗对抗性攻击的弹性,并将其性能与专为单属性设计的 ViTs 进行了比较。此外,我们进一步评估了多属性 ViTs 针对最近一种基于 Transformer 的攻击(称为 Patch-Fool)的鲁棒性。我们在 CelebA 数据集上的实证结果验证了我们的主张。我们的代码可在 https://github.com/hananshafi/MTL-ViT 获取。
引用
@article{arxiv.2402.08070,
title = {Multi-Attribute Vision Transformers are Efficient and Robust Learners},
author = {Hanan Gani and Nada Saadi and Noor Hussein and Karthik Nandakumar},
journal= {arXiv preprint arXiv:2402.08070},
year = {2024}
}
备注
Accepted at IEEE ICIP 2024. arXiv admin note: text overlap with arXiv:2207.08677 by other authors