BoLTVOS:用于视频对象分割的框级跟踪
计算机视觉与模式识别
2020-01-01 v2
摘要
我们将视频对象分割(video object segmentation, VOS)任务拆分为两个子任务:边界框级跟踪,以及边界框分割。遵循该范式,我们提出 BoLTVOS(Box-Level Tracking for VOS),其由一个以首帧边界框为条件来检测感兴趣对象的 R-CNN 检测器、一种时间一致性重打分算法,以及一个将边界框转换为分割掩码的 Box2Seg 网络组成。BoLTVOS 仅使用首帧边界框而不使用掩码来执行 VOS。我们在 DAVIS 2017 和 YouTube-VOS 上评估了我们的方法,结果表明其优于所有不进行首帧微调的方法。我们进一步提出 BoLTVOS-ft,其在跟踪同时使用首帧掩码学习分割所问对象,且不增加运行时间。BoLTVOS-ft 优于 PReMVOS(此前在 DAVIS 2016 和 YouTube-VOS 上性能最佳的 VOS 方法),同时运行速度最高快达 45 倍。我们的边界框跟踪器在边界框级跟踪数据集 OTB 2015 和 LTB35 上也优于所有先前的短期与长期跟踪器。本工作的较新版本见 arXiv:1911.12836。
引用
@article{arxiv.1904.04552,
title = {BoLTVOS: Box-Level Tracking for Video Object Segmentation},
author = {Paul Voigtlaender and Jonathon Luiten and Bastian Leibe},
journal= {arXiv preprint arXiv:1904.04552},
year = {2020}
}