中文

通过全局唯一实例坐标回归的大规模联合语义重定位与场景理解

计算机视觉与模式识别 2019-09-24 v1

摘要

本文提出一种联合语义定位与场景理解的新方法。我们的工作受如下需求驱动:定位算法不仅应预测 6-DoF 相机位姿,还需同时识别周围物体并估计 3D 几何。此类能力对于与环境交互的计算机视觉引导系统(自动驾驶、增强现实与机器人)至关重要。特别地,我们提出一个两步流程。第一步,我们训练卷积神经网络联合预测每像素的全局唯一实例标签以及每个静态物体(如建筑)实例的对应局部坐标。第二步,我们通过结合物体中心坐标与局部坐标获得场景坐标,并用其执行 6-DoF 相机位姿估计。我们在真实世界(CamVid-360)与人工(SceneCity)自动驾驶数据集上评估了我们的方法。在所有数据集上,我们获得了比基于直接位姿回归和基于场景坐标的位姿估计的最先进(state-of-the-art)6-DoF 位姿估计算法更小的平均距离与角度误差。我们的贡献包括:(i)将场景坐标回归新颖地表述为物体实例识别与局部坐标回归两个独立任务,并证明我们所提方案可预测静态物体的精确 3D 几何并估计相机的 6-DoF 位姿;(ii)所用地图比先前场景坐标回归方法尝试的大数个数量级,以及(iii)从建筑对齐长方体等 3D 基元构建的轻量近似 3D 地图。

关键词

引用

@article{arxiv.1909.10239,
  title  = {Large Scale Joint Semantic Re-Localisation and Scene Understanding via Globally Unique Instance Coordinate Regression},
  author = {Ignas Budvytis and Marvin Teichmann and Tomas Vojir and Roberto Cipolla},
  journal= {arXiv preprint arXiv:1909.10239},
  year   = {2019}
}

备注

BMVC 2019