中文

从路径集成视角重新审视视觉Transformer

计算机视觉与模式识别 2023-08-15 v1

摘要

视觉Transformer(ViT)通常被视为Transformer层的堆叠。在本工作中,我们提出一种关于ViT的新视角,表明它们可被视为包含多条不同长度并行路径的集成网络。具体而言,我们将传统的多头自注意力(MSA)与前馈网络(FFN)级联等价地转换为每个Transformer层中的三条并行路径。随后,我们利用新Transformer形式中的恒等连接,进一步将ViT转换为显式的多路径集成网络。从这一新视角来看,这些路径发挥两种作用:其一是直接为分类器提供特征,其二是为后续更长路径提供底层特征表示。我们研究了每条路径对最终预测的影响,发现某些路径甚至会拉低性能。因此,我们提出路径剪枝与EnsembleScale技巧以作改进,前者裁去表现不佳的路径,后者对集成组件重新加权,从而优化路径组合并使短路径专注于为后续路径提供高质量表示。我们还证明,我们的路径组合策略可帮助ViT加深,并充当高通滤波器以滤除部分低频信号。为进一步增强服务于后续路径的路径表示,我们应用自蒸馏将长路径的知识迁移至短路径。本工作呼吁未来从新视角解释和设计ViT的更多研究。

关键词

引用

@article{arxiv.2308.06548,
  title  = {Revisiting Vision Transformer from the View of Path Ensemble},
  author = {Shuning Chang and Pichao Wang and Hao Luo and Fan Wang and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2308.06548},
  year   = {2023}
}

备注

Accepted by ICCV 2023, oral presentation