VLocNet++:用于语义视觉定位与里程计的深度多任务学习
机器人学
2018-10-12 v6 计算机视觉与模式识别
摘要
语义理解与定位是机器人自主性的基本赋能要素,但多数情况下被作为互不相关的问题来处理。尽管深度学习已在广泛的场景理解任务中带来近期突破,但其对状态估计任务的适用性有限,因为其直接式表述使其无法编码场景特定的约束。在本工作中,我们提出 VLocNet++ 架构,该架构采用多任务学习方法,以利用学习语义、回归 6-DoF 全局位姿与里程计之间的任务间关系,使各任务互利。我们的网络通过将世界的几何与语义知识同时嵌入位姿回归网络,克服了上述局限。我们提出一种新颖的自适应加权融合层,以聚合运动特定的时间信息,并基于区域激活将语义特征融合进定位流。此外,我们提出一种自监督扭曲技术,利用相对运动扭曲分割流中的中间网络表示,以学习一致的语义。最后,我们引入了首个带有像素级语义标签与多条回路的城市场景室外定位数据集,用于训练深度网络。在具有挑战性的 Microsoft 7-Scenes 基准与我们的 DeepLoc 数据集上的大量实验表明,我们的方法超越了当前最优水平,优于基于局部特征的方法,同时执行多项任务,并在困难场景中表现出显著的鲁棒性。
引用
@article{arxiv.1804.08366,
title = {VLocNet++: Deep Multitask Learning for Semantic Visual Localization and Odometry},
author = {Noha Radwan and Abhinav Valada and Wolfram Burgard},
journal= {arXiv preprint arXiv:1804.08366},
year = {2018}
}
备注
Demo and dataset available at http://deeploc.cs.uni-freiburg.de