PoseGAN:一种用于相机定位的位姿到图像翻译框架
计算机视觉与模式识别
2020-06-24 v1 机器人学
摘要
相机定位是机器人与计算机视觉中的基本需求。本文引入一种位姿到图像翻译框架来解决相机定位问题。我们提出 PoseGANs,一种基于条件生成对抗网络(cGANs)的位姿到图像翻译实现框架。PoseGANs 具有若干创新,包括基于距离度量的条件判别器以执行相机定位,以及对生成相机图像进行位姿估计作为更强约束以提升相机定位性能。与 PoseNet 等基于学习的回归方法相比,PoseGANs 能以小 70% 的模型规模取得更优性能。此外,PoseGANs 引入视图合成技术以建立 2D 图像与场景间的对应,即给定位姿,PoseGANs 能合成其对应相机图像。进一步,我们论证 PoseGANs 在原理上不同于基于结构的定位与基于学习的回归相机定位,并表明 PoseGANs 利用几何结构完成相机定位任务,因而比依赖局部纹理特征的基于学习回归更稳健且更优。除相机定位与视图合成外,我们还展示了 PoseGANs 可成功用于其他有趣应用,如视频序列中的运动物体消除与帧插值。
引用
@article{arxiv.2006.12712,
title = {PoseGAN: A Pose-to-Image Translation Framework for Camera Localization},
author = {Kanglin Liu and Qing Li and Guoping Qiu},
journal= {arXiv preprint arXiv:2006.12712},
year = {2020}
}