中文

基于解耦视频分割的任意目标跟踪

计算机视觉与模式识别 2023-09-08 v1

摘要

视频分割的训练数据标注成本高昂。这阻碍了端到端算法向新视频分割任务的扩展,尤其是在大词汇量设定下。为了在不针对每个单独任务进行视频数据训练的情况下'跟踪任意目标',我们提出了一种解耦视频分割方法(DEVA),由任务特定的图像级分割与类别/任务无关的双向时间传播组成。由于这一设计,我们仅需一个针对目标任务的图片级模型(训练成本更低)以及一个通用的时间传播模型——后者仅需训练一次即可跨任务泛化。为了有效结合这两个模块,我们使用双向传播对来自不同帧的分割假设进行(半)在线融合,以生成连贯的分割结果。我们表明,在多个数据稀缺任务中,这种解耦公式优于端到端方法,包括大词汇量视频全景分割、开放世界视频分割、指代视频分割和无监督视频目标分割。代码见:https://hkchengrex.github.io/Tracking-Anything-with-DEVA

关键词

引用

@article{arxiv.2309.03903,
  title  = {Tracking Anything with Decoupled Video Segmentation},
  author = {Ho Kei Cheng and Seoung Wug Oh and Brian Price and Alexander Schwing and Joon-Young Lee},
  journal= {arXiv preprint arXiv:2309.03903},
  year   = {2023}
}

备注

Accepted to ICCV 2023. Project page: https://hkchengrex.github.io/Tracking-Anything-with-DEVA