中文

利用视频时空一致性从边界框生成掩码

计算机视觉与模式识别 2021-01-07 v1

摘要

视频中物体分割是一项基础的计算机视觉任务。当前基于深度学习的范式提供了一种强大但依赖数据的解决方案。然而,现有数据集受限于视频中标注物体掩码的成本与人力。这有效限制了现有视频分割方法的性能与泛化能力。为解决此问题,我们探索了较弱的边界框标注形式。我们提出了一种从视频中逐帧边界框标注生成分割掩码的方法。为此,我们设计了一个时空聚合模块,能有效挖掘物体与背景外观在多帧间的一致性。我们利用生成的精确掩码对视频物体分割(VOS)网络进行弱监督训练。我们仅使用大规模跟踪数据集的边界框标注为其生成分割掩码。这些额外数据提供了显著更好的泛化性能,从而在VOS及更具挑战性的跟踪领域均取得最先进结果。

关键词

引用

@article{arxiv.2101.02196,
  title  = {Generating Masks from Boxes by Mining Spatio-Temporal Consistencies in Videos},
  author = {Bin Zhao and Goutam Bhat and Martin Danelljan and Luc Van Gool and Radu Timofte},
  journal= {arXiv preprint arXiv:2101.02196},
  year   = {2021}
}