BoxVIS:基于边界框标注的视频实例分割
计算机视觉与模式识别
2023-07-13 v2 图像与视频处理
摘要
在视频中标注像素级目标掩码昂贵且费时费力。因此,现有视频实例分割(VIS)数据集中像素级标注数量少,限制了训练VIS模型的泛化能力。一种替代但便宜得多的解决方案是使用边界框标注视频中的实例。受近期框监督图像实例分割成功的启发,我们将最先进的像素监督VIS模型适配为框监督VIS(BoxVIS)基线,并观察到轻微的性能下降。我们随之提出从两方面提升BoxVIS性能。首先,我们提出框中心引导的时空成对亲和(STPA)损失以预测实例掩码,获得更好的空间与时间一致性。其次,我们通过整合当前VIS基准的视频并将COCO数据集的图像转换为短伪视频片段,收集了更大规模的框标注VIS数据集(BVISD)。利用提出的BVISD与STPA损失,我们训练的BoxVIS模型在YouTube-VIS 2021与OVIS验证集上分别达到43.2%与29.0%的掩码AP。它仅使用最先进像素监督VIS模型16%的标注时间与成本,便展现出可比的实例掩码预测性能与更好的泛化能力。代码与数据见 \url{https://github.com/MinghanLi/BoxVIS}。
引用
@article{arxiv.2303.14618,
title = {BoxVIS: Video Instance Segmentation with Box Annotations},
author = {Minghan Li and Lei Zhang},
journal= {arXiv preprint arXiv:2303.14618},
year = {2023}
}