基于隐式映射的视觉 3D 定位学习模型
计算机视觉与模式识别
2018-12-13 v2 机器学习
机器学习
摘要
我们考虑基于学习的视觉定位方法,其不需要以点云或体素形式构建显式地图。目标是学习在更高、更抽象层次上的环境隐式表示。我们提出使用基于生成式查询网络 (GQNs, Eslami et al. 2018) 的生成式方法,并提出以下问题:1) GQN 能否捕捉比其最初演示的更复杂的场景?2) GQN 能否用于这些场景中的定位?为研究该方法,我们考虑程序化生成的 Minecraft 世界,可为其生成复杂 3D 场景图像及相机位姿坐标。我们首先展示,增强了新型注意力机制的 GQN 能够捕捉 Minecraft 中 3D 场景的结构,这由其采样结果所证实。然后将模型应用于定位问题,将结果与判别基线进行比较,并比较每种方法捕捉任务不确定性的方式。
引用
@article{arxiv.1807.03149,
title = {Learning models for visual 3D localization with implicit mapping},
author = {Dan Rosenbaum and Frederic Besse and Fabio Viola and Danilo J. Rezende and S. M. Ali Eslami},
journal= {arXiv preprint arXiv:1807.03149},
year = {2018}
}