基于掩码传播的视频中目标实例分类、分割与跟踪
计算机视觉与模式识别
2021-07-13 v4
摘要
我们提出了一种在视频序列中同时分类、分割和跟踪目标实例的方法。我们的方法名为 MaskProp,通过将流行的 Mask R-CNN 适配到视频上,增加了一个掩码传播分支,将每帧的帧级目标实例掩码传播到视频片段中的所有其他帧。这使得我们的系统能够针对片段中间帧中分割出的目标实例预测片段级实例轨迹。为序列中每一帧密集生成的片段级实例轨迹最终被聚合以产生视频级目标实例分割与分类。我们的实验表明,片段级实例分割使我们的方法对视频中的运动模糊和目标遮挡具有鲁棒性。MaskProp 在 YouTube-VIS 数据集上取得了已报道的最佳精度,尽管其更为简单且使用的标注数据量少几个数量级(130 万对比 10 亿图像、86 万对比 1400 万边界框),仍优于 ICCV 2019 视频实例分割挑战赛冠军。
引用
@article{arxiv.1912.04573,
title = {Classifying, Segmenting, and Tracking Object Instances in Video with Mask Propagation},
author = {Gedas Bertasius and Lorenzo Torresani},
journal= {arXiv preprint arXiv:1912.04573},
year = {2021}
}
备注
CVPR 2020 Best Paper Nominee