中文

基于 Transformer 的多场景绝对位姿回归学习

计算机视觉与模式识别 2021-07-27 v2

摘要

绝对相机位姿回归器仅从所捕获图像估计相机的位置与朝向。通常,带有多层感知机头的卷积骨干网络以图像和位姿标签进行训练,每次嵌入单个参考场景。近来,该方案通过用一组全连接层替换 MLP 头而扩展至学习多场景。在本工作中,我们提出使用 Transformer 学习多场景绝对相机位姿回归,其中编码器通过自注意力聚合激活图,解码器将潜特征与场景编码转换为候选位姿预测。该机制使我们的模型聚焦于对定位具有信息量的通用特征,同时并行嵌入多个场景。我们在常用的基准室内与室外数据集上评估了我们的方法,并表明其超越了多场景及最先进的单场景绝对位姿回归器。我们的代码已公开于 https://github.com/yolish/multi-scene-pose-transformer。

关键词

引用

@article{arxiv.2103.11468,
  title  = {Learning Multi-Scene Absolute Pose Regression with Transformers},
  author = {Yoli Shavit and Ron Ferens and Yosi Keller},
  journal= {arXiv preprint arXiv:2103.11468},
  year   = {2021}
}