中文

开放世界中的视频实例分割

计算机视觉与模式识别 2023-04-04 v1

摘要

现有的视频实例分割(VIS)方法通常遵循封闭世界假设,即在推理时仅识别已见类别的实例并对其进行时空分割。开放世界设定放宽了封闭世界静态学习的假设,具体如下:(a)首先,它区分一组已知类别并将未知物体标记为“未知”;(b)随后,当相应的语义标签可用时,逐步学习该未知物体的类别。我们提出了首个开放世界VIS方法,称为OW-VISFormer,其引入了一种新颖的特征增强机制与时空物体性(STO)模块。基于轻量级辅助网络的特征增强机制旨在从背景中精确描绘像素级(未知)物体,并区分特定类别的已知语义类。STO模块通过对比损失增强前景激活,致力于生成实例级伪标签。此外,我们还引入了一套广泛的实验协议来衡量OW-VIS的特性。我们的OW-VISFormer在OW-VIS设定下相较强基线表现更优。进一步地,我们将所提贡献集成到近期的SeqFormer中,在标准全监督VIS设定下进行评估,在Youtube-VIS 2019验证集上取得了1.6% AP的绝对提升。最后,我们展示了我们的贡献在开放世界检测(OWOD)设定下的泛化能力,优于文献中现有最佳的OWOD方法。代码、模型以及OW-VIS划分已发布于\url{https://github.com/OmkarThawakar/OWVISFormer}。

关键词

引用

@article{arxiv.2304.01200,
  title  = {Video Instance Segmentation in an Open-World},
  author = {Omkar Thawakar and Sanath Narayan and Hisham Cholakkal and Rao Muhammad Anwer and Salman Khan and Jorma Laaksonen and Mubarak Shah and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2304.01200},
  year   = {2023}
}

备注

9 pages, 5 figures