中文

用于视频实例分割的时空嵌入学习

计算机视觉与模式识别 2019-12-20 v1

摘要

我们提出了一种用于视频实例分割的新型嵌入方法。我们的方法学习一种融合外观、运动和几何线索的时空嵌入;其中由三维因果卷积网络建模运动,由单目自监督深度损失建模几何。在该嵌入空间中,同一实例的视频像素被聚在一起,同时与其他实例分离,从而无需任何复杂后处理即可随时间自然跟踪实例。由于我们的架构完全因果——与先前方法相反,我们不引入来自未来帧的信息——我们的网络可实时运行。我们表明,即使在遮挡和漏检情况下,我们的模型也能准确跟踪和分割实例,在 KITTI 多目标与跟踪数据集上推进了当前最优水平。

关键词

引用

@article{arxiv.1912.08969,
  title  = {Learning a Spatio-Temporal Embedding for Video Instance Segmentation},
  author = {Anthony Hu and Alex Kendall and Roberto Cipolla},
  journal= {arXiv preprint arXiv:1912.08969},
  year   = {2019}
}