基于傅里叶域分析的深度视觉 Transformer 抗过平滑:从理论到实践
计算机视觉与模式识别
2022-03-14 v1 机器学习
摘要
视觉 Transformer(ViT)近期在计算机视觉问题中展现出潜力。然而,与卷积神经网络(CNN)不同,已知 ViT 的性能会随着深度增加而迅速饱和,原因在于观测到的注意力崩溃或图像块均匀化。尽管已有若干经验性解决方案,研究该可扩展性问题的严格框架仍付之阙如。本文中,我们首先建立一个严格的理论框架,从傅里叶频谱域分析 ViT 特征。我们表明自注意力机制本质上等价于低通滤波器,这意味着当 ViT 加深时,过度的低通滤波将导致特征图仅保留其直流(DC)分量。随后我们提出两种简单而有效的技术来缓解这一不良的低通局限。第一种技术称为 AttnScale,将自注意力块分解为低通和高通分量,然后重新缩放并组合这两个滤波器以产生全通自注意力矩阵。第二种技术称为 FeatScale,在分离频带上对特征图重新加权以放大高频信号。两种技术均高效且无超参数,同时有效克服相关的 ViT 训练伪影如注意力崩溃与图像块均匀化。通过将我们的技术无缝插入多种 ViT 变体,我们证明它们持续帮助 ViT 受益于更深架构,带来高达 1.1% 的“免费”性能提升(例如,参数开销极小)。我们在 https://github.com/VITA-Group/ViT-Anti-Oversmoothing 公开发布代码与预训练模型。
引用
@article{arxiv.2203.05962,
title = {Anti-Oversmoothing in Deep Vision Transformers via the Fourier Domain Analysis: From Theory to Practice},
author = {Peihao Wang and Wenqing Zheng and Tianlong Chen and Zhangyang Wang},
journal= {arXiv preprint arXiv:2203.05962},
year = {2022}
}
备注
International Conference on Learning Representations (ICLR), 2022