中文

通过环视静态场景与神经三维映射实现跟踪

计算机视觉与模式识别 2020-08-05 v1

摘要

我们假设,能够在静态场景中环视的智能体可以学习到适用于复杂动态场景中三维目标跟踪的丰富视觉表征。我们在此追求中的动机是,物理世界本身大多是静态的,并且在静态场景中收集多视角对应标签相对便宜,例如通过三角测量。我们提出利用任意场景(静态或动态)中静态点的多视角数据,来学习一个神经三维映射模块,该模块产生跨时间可对应的特征。该神经三维映射器以RGB-D数据作为输入,并输出一个深度特征的三维体素网格。我们使用对比损失训练体素特征以在视角间可对应,而跨时间的对应性自动涌现。在测试时,给定带有近似相机位姿的RGB-D视频,以及待跟踪目标的3D框,我们通过生成每个时间步的地图并在每个地图中定位目标特征来进行目标跟踪。与以2D或2.5D表示视频流的模型不同,我们的模型的三维场景表征与投影伪影解耦,在相机运动下稳定,并且对部分遮挡具有鲁棒性。我们在具有挑战性的模拟和真实数据中测试所提出的架构,并表明我们的无监督三维目标跟踪器优于先前的无监督2D和2.5D跟踪器,并接近有监督跟踪器的精度。本工作表明,三维目标跟踪器可以通过静态数据的多视角自监督而在没有跟踪标签的情况下涌现。

关键词

引用

@article{arxiv.2008.01295,
  title  = {Tracking Emerges by Looking Around Static Scenes, with Neural 3D Mapping},
  author = {Adam W. Harley and Shrinidhi K. Lakshmikanth and Paul Schydlo and Katerina Fragkiadaki},
  journal= {arXiv preprint arXiv:2008.01295},
  year   = {2020}
}