中文

具有块多样化的视觉Transformer

计算机视觉与模式识别 2021-06-14 v3 机器学习

摘要

视觉transformer在具有挑战性的计算机视觉任务上已展现出有前景的性能。然而,直接训练视觉transformer可能产生不稳定和次优的结果。近期工作提出通过修改transformer结构(例如引入卷积层)来提升视觉transformer性能。相反,我们研究一种正交方法,在不修改网络的情况下稳定视觉transformer训练。我们观察到训练的不稳定性可归因于所提取块表示之间的显著相似性。更具体地,对于深层视觉transformer,自注意力块倾向于将不同块映射为相似的隐表示,导致信息损失与性能下降。为缓解该问题,本工作中我们在视觉transformer训练中引入新颖损失函数,以显式鼓励块表示间的多样性,从而实现更具判别性的特征提取。我们通过经验表明,所提技术稳定了训练,并使我们能够训练更宽更深的视觉transformer。我们进一步表明多样化特征显著有益于迁移学习中的下游任务。对于语义分割,我们提升了Cityscapes与ADE20k上的最先进(SOTA)结果。我们的代码见https://github.com/ChengyueGongR/PatchVisionTransformer。

关键词

引用

@article{arxiv.2104.12753,
  title  = {Vision Transformers with Patch Diversification},
  author = {Chengyue Gong and Dilin Wang and Meng Li and Vikas Chandra and Qiang Liu},
  journal= {arXiv preprint arXiv:2104.12753},
  year   = {2021}
}

备注

preprint