面向相机位姿估计的网络域自适应:无需位姿标签学习相机位姿估计
计算机视觉与模式识别
2021-11-30 v1
摘要
深度学习的主要批评之一在于,为训练具备高性能与良好泛化能力的模型,需要大量昂贵且难以获取的标注数据。聚焦于通过场景坐标回归(SCR)进行单目相机位姿估计的任务,我们提出一种新方法——相机位姿估计网络域自适应(DANCE),其能够在无需任何目标任务标签的情况下训练模型。DANCE 需要无标签图像(无已知位姿、顺序或场景坐标标签)以及空间的 3D 表示(例如扫描点云),二者均可利用现成商用硬件以极小代价获取。DANCE 从 3D 模型渲染带标签的合成图像,并通过无监督图像级域自适应技术(非配对图像到图像翻译)弥合合成与真实图像之间不可避免的域鸿沟。在真实图像上测试时,经 DANCE 训练的 SCR 模型以极低成本取得了与全监督对应模型相当的性能(二者均使用 PnP-RANSAC 进行最终位姿估计)。我们的代码与数据集发布于 https://github.com/JackLangerman/dance
引用
@article{arxiv.2111.14741,
title = {Domain Adaptation of Networks for Camera Pose Estimation: Learning Camera Pose Estimation Without Pose Labels},
author = {Jack Langerman and Ziming Qiu and Gábor Sörös and Dávid Sebők and Yao Wang and Howard Huang},
journal= {arXiv preprint arXiv:2111.14741},
year = {2021}
}