将抗锯齿融入视觉 Transformer
计算机视觉与模式识别
2021-10-29 v1
摘要
基于自注意力机制且无卷积设计的 Transformer 架构,近期在计算机视觉中展现出优越性能与蓬勃应用。然而,不连续的块级分词过程隐式地将锯齿状伪影引入注意力图,从而给视觉 Transformer 带来了传统的混叠问题。当使用离散模式生成高频或连续信息时,就会发生混叠效应,导致难以区分的失真。近期研究已发现现代卷积网络仍受此现象困扰。在本文中,我们分析视觉 Transformer 中尚未被探讨的混叠问题,并探索融入抗锯齿特性。具体而言,我们提出一个即插即用的抗混叠模块(ARM)以缓解上述问题。我们在多个任务与各类视觉 Transformer 架构上研究了所提方法的有效性与泛化性。这一轻量设计在多个著名结构上持续取得明显提升。此外,我们的模块还提升了视觉 Transformer 的数据效率与鲁棒性。
引用
@article{arxiv.2110.15156,
title = {Blending Anti-Aliasing into Vision Transformer},
author = {Shengju Qian and Hao Shao and Yi Zhu and Mu Li and Jiaya Jia},
journal= {arXiv preprint arXiv:2110.15156},
year = {2021}
}
备注
Accepted to NeurIPS 2021