利用图像匹配实现端到端相对相机位姿回归
计算机视觉与模式识别
2024-04-17 v2
摘要
本文提出一种可泛化的、基于端到端深度学习的两图像间相对位姿回归方法。给定从不同的视点拍摄的同一场景的两幅图像,我们的方法预测两个相应相机之间的相对旋转和平移(包括方向和尺度)。受经典流程启发,我们的方法利用图像匹配(IM)作为相对位姿回归的预训练任务。具体而言,我们使用LoFTR,一种利用基于注意力的网络在Scannet上预训练的架构,来提取半稠密特征图,然后将其扭曲并输入到位姿回归网络中。值得注意的是,我们使用了一个利用独立项分别考虑平移方向和尺度的损失函数。我们认为这种分离很重要,因为平移方向由点对应决定,而尺度是从形状大小的先验中推断的。我们的消融实验进一步支持了这一选择。我们在多个数据集上评估了我们的方法,并表明它优于以往的端到端方法。该方法对未见过的数据集也泛化良好。
引用
@article{arxiv.2211.14950,
title = {Leveraging Image Matching Toward End-to-End Relative Camera Pose Regression},
author = {Fadi Khatib and Yuval Margalit and Meirav Galun and Ronen Basri},
journal= {arXiv preprint arXiv:2211.14950},
year = {2024}
}
备注
Project webpage: https://fadikhatib.github.io/GRelPose