中文

MOLTR:基于单目 RGB 视频的多目标定位、跟踪与重建

计算机视觉与模式识别 2021-02-16 v2

摘要

语义感知重建比仅几何重建对未来机器人与 AR/VR 应用更具优势,因其不仅表示事物在何处,还表示事物是什么。以对象为中心的建图是一项构建对象级重建的任务,其中对象是分离且有意义的实体,传达几何与语义信息。在本文中,我们提出 MOLTR,一种仅使用单目图像序列与相机位姿实现以对象为中心建图的方案。它能够在 RGB 相机捕获周围视频时,以在线方式定位、跟踪并重建多个对象。给定新 RGB 帧,MOLTR 首先应用单目 3D 检测器定位感兴趣对象并提取其形状码(shape codes)——在习得嵌入空间中表示对象形状。检测经数据关联后合并至地图中已有对象。每个对象的运动状态(即运动学与运动状态)由多模型贝叶斯滤波器跟踪,对象形状通过融合多个形状码逐步精炼。我们在室内与室外场景的基准数据集上评估定位、跟踪与重建,并展示优于以往方法的性能。

关键词

引用

@article{arxiv.2012.05360,
  title  = {MOLTR: Multiple Object Localisation, Tracking, and Reconstruction from Monocular RGB Videos},
  author = {Kejie Li and Hamid Rezatofighi and Ian Reid},
  journal= {arXiv preprint arXiv:2012.05360},
  year   = {2021}
}

备注

Accepted at IEEE Robotics and Automation Letters