中文

VITA:基于目标令牌关联的视频实例分割

计算机视觉与模式识别 2022-10-21 v2

摘要

我们提出一种用于离线视频实例分割(VIS)的新范式,其基于如下假设:显式的面向对象信息可作为理解整个序列上下文的有力线索。为此,我们提出VITA,一种构建在现成基于Transformer的图像实例分割模型之上的简单结构。具体而言,我们使用图像目标检测器将特定于目标的上下文提炼为对象令牌。VITA通过关联帧级对象令牌实现视频级理解,而无需使用时空骨干特征。通过利用浓缩信息有效建立对象间关系,VITA在采用ResNet-50骨干的VIS基准上取得最先进性能:在YouTube-VIS 2019与2021上分别为49.8 AP、45.7 AP,在OVIS上为19.6 AP。此外,得益于其与骨干特征解耦的基于对象令牌的结构,VITA展现出以往离线VIS方法未探索的若干实用优势——使用普通GPU处理长时高分辨率视频,以及冻结在图像域训练好的帧级检测器。代码见 https://github.com/sukjunhwang/VITA。

关键词

引用

@article{arxiv.2206.04403,
  title  = {VITA: Video Instance Segmentation via Object Token Association},
  author = {Miran Heo and Sukjun Hwang and Seoung Wug Oh and Joon-Young Lee and Seon Joo Kim},
  journal= {arXiv preprint arXiv:2206.04403},
  year   = {2022}
}