无掩码视频实例分割
计算机视觉与模式识别
2023-03-29 v1 人工智能
摘要
视频实例分割(VIS)近期的进展很大程度上由更深且日益依赖数据的基于 transformer 的模型推动。然而,视频掩码标注繁琐且昂贵,限制了现有 VIS 数据集的规模与多样性。本工作中,我们旨在去除掩码标注要求。我们提出 MaskFreeVIS,仅使用边界框标注表示物体状态,即取得极具竞争力的 VIS 性能。我们通过引入时序 KNN 块损失(TK-Loss)利用视频中丰富的时序掩码一致性约束,无需任何标签即提供强掩码监督。我们的 TK-Loss 通过高效的块匹配步骤及随后的 K 近邻选择,寻找跨帧的一对多匹配,随后对所得匹配施加一致性损失。我们的无掩码目标实现简单、无可训练参数、计算高效,却优于采用例如最先进光流以强制时序掩码一致性的基线。我们在 YouTube-VIS 2019/2021、OVIS 与 BDD100K MOTS 基准上验证 MaskFreeVIS。结果通过大幅缩小全监督与弱监督 VIS 性能间的差距,清晰展示了我们方法的有效性。我们的代码与训练模型见于 https://github.com/SysCV/MaskFreeVis。
引用
@article{arxiv.2303.15904,
title = {Mask-Free Video Instance Segmentation},
author = {Lei Ke and Martin Danelljan and Henghui Ding and Yu-Wing Tai and Chi-Keung Tang and Fisher Yu},
journal= {arXiv preprint arXiv:2303.15904},
year = {2023}
}
备注
Accepted in CVPR 2023; Code: https://github.com/SysCV/MaskFreeVis; Project page: http://vis.xyz/pub/maskfreevis