基于 Transformers 的由粗到细多场景位姿回归
计算机视觉与模式识别
2023-08-24 v1 机器学习
摘要
绝对相机位姿回归器仅根据所捕获图像估计相机的位置与朝向。典型地,带有多层感知机(MLP)头的卷积骨干使用图像与位姿标签训练,以一次嵌入单个参考场景。近来,该方案被扩展为通过以一组全连接层替换 MLP 头来学习多场景。本工作中,我们提出利用 Transformers 学习多场景绝对相机位姿回归,其中编码器以自注意力聚合激活图,解码器将潜在特征与场景编码转换为位姿预测。这使我们的模型聚焦于对定位具信息性的通用特征,同时并行嵌入多个场景。我们扩展先前 MS-Transformer 方法 \cite{shavit2021learning},引入一种混合分类-回归架构以提升定位精度。我们的方法在常用基准室内与室外数据集上评估,并被证明超越多场景及 SOTA 单场景绝对位姿回归器。
引用
@article{arxiv.2308.11783,
title = {Coarse-to-Fine Multi-Scene Pose Regression with Transformers},
author = {Yoli Shavit and Ron Ferens and Yosi Keller},
journal= {arXiv preprint arXiv:2308.11783},
year = {2023}
}
备注
Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). arXiv admin note: substantial text overlap with arXiv:2103.11468