用于视频实例分割的时空嵌入学习
计算机视觉与模式识别
2019-12-20 v1
摘要
我们提出了一种用于视频实例分割的新型嵌入方法。我们的方法学习一种融合外观、运动和几何线索的时空嵌入;其中由三维因果卷积网络建模运动,由单目自监督深度损失建模几何。在该嵌入空间中,同一实例的视频像素被聚在一起,同时与其他实例分离,从而无需任何复杂后处理即可随时间自然跟踪实例。由于我们的架构完全因果——与先前方法相反,我们不引入来自未来帧的信息——我们的网络可实时运行。我们表明,即使在遮挡和漏检情况下,我们的模型也能准确跟踪和分割实例,在 KITTI 多目标与跟踪数据集上推进了当前最优水平。
引用
@article{arxiv.1912.08969,
title = {Learning a Spatio-Temporal Embedding for Video Instance Segmentation},
author = {Anthony Hu and Alex Kendall and Roberto Cipolla},
journal= {arXiv preprint arXiv:1912.08969},
year = {2019}
}