中文

O-ViT:正交视觉Transformer

计算机视觉与模式识别 2022-02-17 v2 机器学习

摘要

受自注意力机制在自然语言处理中巨大成功的启发,Vision Transformer (ViT)创造性地将之应用于图像块序列并取得了令人惊叹的性能。然而,ViT的缩放点积自注意力给原始特征空间的结构带来了尺度模糊性。为解决该问题,我们提出一种名为正交视觉Transformer (O-ViT)的新方法,从几何角度优化ViT。O-ViT将自注意力块的参数限制在保持范数的正交流形上,从而能够保持特征空间的几何结构。此外,O-ViT通过采用正交群与其李代数之间的满射映射,实现了正交约束与低开销优化。我们在图像识别任务上进行了对比实验以证明O-ViT的有效性,实验表明O-ViT可将ViT的性能提升多达3.6%。

关键词

引用

@article{arxiv.2201.12133,
  title  = {O-ViT: Orthogonal Vision Transformer},
  author = {Yanhong Fei and Yingjie Liu and Xian Wei and Mingsong Chen},
  journal= {arXiv preprint arXiv:2201.12133},
  year   = {2022}
}