中文

视觉 Transformer 的多流形注意力

计算机视觉与模式识别 2024-10-28 v3

摘要

视觉 Transformer 如今非常流行,因其在若干计算机视觉任务(如图像分类与动作识别)中具备最先进的性能。尽管其性能已通过高度描述性的块嵌入与层次化结构得到极大增强,但关于利用额外数据表示以精炼 Transformer 自注意力图的研究仍然有限。为解决该问题,本文提出一种称为多流形多头注意力的新型注意力机制,以替代 Transformer 的原始自注意力。所提机制在三个不同流形——即欧氏流形、对称正定流形与 Grassmann 流形——上对输入空间建模,从而利用输入的不同统计与几何性质来计算高度描述性的注意力图。以此方式,所提注意力机制可引导视觉 Transformer 对图像的重要外观、颜色与纹理特征更加关注,如知名数据集上的实验结果所示,带来了分类与分割结果的提升。

关键词

引用

@article{arxiv.2207.08569,
  title  = {Multi-manifold Attention for Vision Transformers},
  author = {Dimitrios Konstantinidis and Ilias Papastratis and Kosmas Dimitropoulos and Petros Daras},
  journal= {arXiv preprint arXiv:2207.08569},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication