TCOVIS:时间一致的在线视频实例分割
计算机视觉与模式识别
2023-09-22 v1
摘要
近年来,视频实例分割(VIS)取得了显著进展,许多离线和在线方法达到了最先进的性能。离线方法具有产生时间一致预测的优势,但不适用于实时场景。相反,在线方法更实用,但保持时间一致性仍是一项具有挑战性的任务。本文中,我们提出了一种新颖的在线视频实例分割方法,称为TCOVIS,其充分利用了视频片段中的时间信息。我们方法的核心包括一个全局实例分配策略和一个时空增强模块,从两方面改善了特征的时间一致性。具体而言,我们在整个视频片段上对预测与真值进行全局最优匹配,并以全局最优目标监督模型。我们还捕获空间特征并将其与帧间语义特征聚合,从而实现时空增强。我们在四个广泛采用的VIS基准(即YouTube-VIS 2019/2021/2022和OVIS)上评估了我们的方法,并在无任何额外技巧的情况下于所有基准上达到了最先进的性能。例如,在YouTube-VIS 2021上,TCOVIS使用ResNet-50和Swin-L骨干分别实现了49.5 AP和61.3 AP。代码见 https://github.com/jun-long-li/TCOVIS。
引用
@article{arxiv.2309.11857,
title = {TCOVIS: Temporally Consistent Online Video Instance Segmentation},
author = {Junlong Li and Bingyao Yu and Yongming Rao and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2309.11857},
year = {2023}
}
备注
11 pages, 4 figures. This paper has been accepted for ICCV 2023