中文

GTA:一种用于多视角Transformer的几何感知注意力机制

计算机视觉与模式识别 2024-06-10 v3 人工智能 机器学习 机器学习

摘要

由于Transformer对输入token的排列具有等变性,对许多任务而言编码token的位置信息是必要的。然而,现有的位置编码方案最初是为NLP任务设计的,其对于通常具有不同数据结构特性的视觉任务的适用性值得怀疑。我们认为,现有的位置编码方案对于3D视觉任务是次优的,因为它们没有遵循数据底层的3D几何结构。基于这一假设,我们提出了一种几何感知注意力机制,将token的几何结构编码为由查询与键值对之间几何关系所决定的相对变换。通过在稀疏宽基线多视角设置下的多个新视角合成(NVS)数据集上进行评估,我们表明,我们提出的称为几何变换注意力(Geometric Transform Attention, GTA)的注意力机制,在不引入任何额外可学习参数且仅带来微小计算开销的情况下,提升了基于SOTA transformer的NVS模型的学习效率与性能。

关键词

引用

@article{arxiv.2310.10375,
  title  = {GTA: A Geometry-Aware Attention Mechanism for Multi-View Transformers},
  author = {Takeru Miyato and Bernhard Jaeger and Max Welling and Andreas Geiger},
  journal= {arXiv preprint arXiv:2310.10375},
  year   = {2024}
}

备注

Published as a conference paper at ICLR 2024