MIA-Former:通过多粒度输入自适应实现高效鲁棒视觉 Transformer
计算机视觉与模式识别
2021-12-23 v1 机器学习
摘要
ViT 通常计算开销过大,难以部署到现实世界中资源受限的设备上,原因在于(1)其复杂度随输入 token 数量呈二次增长,以及(2)其过度参数化的自注意力头和模型深度。同时,不同图像复杂度各异,且不同区域可包含不同层次的视觉信息,这表明在模型复杂度上对所有区域/token 同等对待是不必要的,而此类缩减 ViT 复杂度的机会尚未被充分探索。为此,我们提出一种称为 MIA-Former 的多粒度输入自适应视觉 Transformer 框架,能够以输入自适应的方式在三种由粗到细的粒度(即模型深度以及模型头数/token 数)上调整 ViT 的结构。具体而言,我们的 MIA-Former 采用以混合监督与强化训练方法训练的低开销网络,以输入自适应方式跳过不必要的层、头和 token,从而降低整体计算成本。此外,我们 MIA-Former 一个有趣的副作用是,其所生成的 ViT 相较于静态对应模型天然具备增强的抗对抗攻击鲁棒性,因为 MIA-Former 的多粒度动态控制提升了模型多样性,类似于集成效果,从而增加了针对其所有子模型进行对抗攻击的难度。大量实验与消融研究证实,所提出的 MIA-Former 框架能够有效依据输入图像难度分配计算预算,同时提升鲁棒性,实现了最先进(SOTA)的精度-效率权衡,例如,与 SOTA 动态 transformer 模型相比,在相同甚至更高精度下节省 20% 计算量。
引用
@article{arxiv.2112.11542,
title = {MIA-Former: Efficient and Robust Vision Transformers via Multi-grained Input-Adaptation},
author = {Zhongzhi Yu and Yonggan Fu and Sicheng Li and Chaojian Li and Yingyan Lin},
journal= {arXiv preprint arXiv:2112.11542},
year = {2021}
}