中文

具有注意力图幻觉与 FFN 压缩的视觉 Transformer

计算机视觉与模式识别 2023-06-21 v1

摘要

Vision Transformer (ViT) 现主导众多视觉任务。其逐 token 多头自注意力 (MHSA) 的二次复杂度缺陷,已通过 token 稀疏化或降维(空间或通道)被广泛解决。然而,MHSA 中固有的冗余常被忽视,前馈网络 (FFN) 亦然。为此,我们提出注意力图幻觉与 FFN 压缩以填补空白。具体而言,我们观察到原始 ViT 中存在相似注意力图,并提出以廉价得多的操作从其余图中幻觉出半数注意力图,称为幻觉 MHSA (hMHSA)。对于 FFN,我们对其隐层到输出的投影矩阵进行因式分解,并利用重参数化技术增强其能力,使其成为紧凑 FFN (cFFN)。借助所提模块,各类基于 ViT 的主干网络(包括直连式 (DeiT)、混合式 (NextViT) 与分层式 (PVT) 结构)实现了浮点运算量 (FLOPs) 与参数量 (Params) 的 10%–20% 削减,同时性能颇具竞争力。

关键词

引用

@article{arxiv.2306.10875,
  title  = {Vision Transformer with Attention Map Hallucination and FFN Compaction},
  author = {Haiyang Xu and Zhichao Zhou and Dongliang He and Fu Li and Jingdong Wang},
  journal= {arXiv preprint arXiv:2306.10875},
  year   = {2023}
}