中文

激活自注意力以实现多场景绝对姿态回归

计算机视觉与模式识别 2024-11-19 v2

摘要

多场景绝对姿态回归满足了在各种真实环境中的快速且内存高效的相机姿态估计需求。如今,基于Transformer的模型已被设计用于直接回归多场景中的相机姿态。尽管具有潜力,但Transformer编码器因自注意力图的坍缩而未被充分利用,表示能力较低。本工作揭示了这一问题,并从一个新的角度进行研究:查询-键嵌入空间的畸变。根据统计分析,我们发现查询和键被映射到完全不同的空间,而仅有少数键被混合到查询区域中。这导致自注意力图的坍缩,因为所有查询都被认为与那少数键相似。因此,我们提出了简单但有效的方案来激活自注意力。具体而言,我们提出了一种辅助损失,用于对齐查询和键,防止查询-键空间的畸变,并鼓励模型通过自注意力发现全局关系。此外,采用固定的正弦位置编码代替训练不足的可学习位置编码,将适当的位置线索反映到自注意力的输入中。因此,我们的方法有效解决了上述问题,在室外和室内场景中均优于现有方法。

关键词

引用

@article{arxiv.2411.01443,
  title  = {Activating Self-Attention for Multi-Scene Absolute Pose Regression},
  author = {Miso Lee and Jihwan Kim and Jae-Pil Heo},
  journal= {arXiv preprint arXiv:2411.01443},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024