基于图注意力网络的动态场景相机重定位方法
计算机视觉与模式识别
2022-10-03 v1 人工智能
机器学习
摘要
我们设计了一种基于图注意力网络的方法,用于学习场景三角网格表示,以在动态环境中估计图像相机位姿。先前的方法构建了显式或隐式嵌入场景结构的场景相关模型,并使用卷积神经网络或决策树建立 2D/3D-3D 对应关系。这种映射过拟合目标场景,且不能很好地泛化到环境中的动态变化。我们的工作引入了一种新方法,利用可用的三角网格解决相机重定位问题。我们的 3D-3D 匹配框架由三个模块组成:(1) 一个图神经网络用于计算网格顶点的嵌入,(2) 一个卷积神经网络用于计算定义在 RGB-D 图像上的网格单元的嵌入,(3) 一个神经网络模型用于建立两种嵌入之间的对应关系。这三个组件以端到端方式训练。为预测最终位姿,我们运行 RANSAC 算法生成相机位姿假设,并使用点云表示细化预测。在 RIO10 动态室内相机重定位基准上,我们的方法将最先进方法的相机位姿精度从 显著提高到 。
引用
@article{arxiv.2209.15056,
title = {Graph Attention Network for Camera Relocalization on Dynamic Scenes},
author = {Mohamed Amine Ouali and Mohamed Bouguessa and Riadh Ksantini},
journal= {arXiv preprint arXiv:2209.15056},
year = {2022}
}