中文

BoLTVOS:用于视频对象分割的框级跟踪

计算机视觉与模式识别 2020-01-01 v2

摘要

我们将视频对象分割(video object segmentation, VOS)任务拆分为两个子任务:边界框级跟踪,以及边界框分割。遵循该范式,我们提出 BoLTVOS(Box-Level Tracking for VOS),其由一个以首帧边界框为条件来检测感兴趣对象的 R-CNN 检测器、一种时间一致性重打分算法,以及一个将边界框转换为分割掩码的 Box2Seg 网络组成。BoLTVOS 仅使用首帧边界框而不使用掩码来执行 VOS。我们在 DAVIS 2017 和 YouTube-VOS 上评估了我们的方法,结果表明其优于所有不进行首帧微调的方法。我们进一步提出 BoLTVOS-ft,其在跟踪同时使用首帧掩码学习分割所问对象,且不增加运行时间。BoLTVOS-ft 优于 PReMVOS(此前在 DAVIS 2016 和 YouTube-VOS 上性能最佳的 VOS 方法),同时运行速度最高快达 45 倍。我们的边界框跟踪器在边界框级跟踪数据集 OTB 2015 和 LTB35 上也优于所有先前的短期与长期跟踪器。本工作的较新版本见 arXiv:1911.12836。

关键词

引用

@article{arxiv.1904.04552,
  title  = {BoLTVOS: Box-Level Tracking for Video Object Segmentation},
  author = {Paul Voigtlaender and Jonathon Luiten and Bastian Leibe},
  journal= {arXiv preprint arXiv:1904.04552},
  year   = {2020}
}