基于解耦视频分割的任意目标跟踪
计算机视觉与模式识别
2023-09-08 v1
摘要
视频分割的训练数据标注成本高昂。这阻碍了端到端算法向新视频分割任务的扩展,尤其是在大词汇量设定下。为了在不针对每个单独任务进行视频数据训练的情况下'跟踪任意目标',我们提出了一种解耦视频分割方法(DEVA),由任务特定的图像级分割与类别/任务无关的双向时间传播组成。由于这一设计,我们仅需一个针对目标任务的图片级模型(训练成本更低)以及一个通用的时间传播模型——后者仅需训练一次即可跨任务泛化。为了有效结合这两个模块,我们使用双向传播对来自不同帧的分割假设进行(半)在线融合,以生成连贯的分割结果。我们表明,在多个数据稀缺任务中,这种解耦公式优于端到端方法,包括大词汇量视频全景分割、开放世界视频分割、指代视频分割和无监督视频目标分割。代码见:https://hkchengrex.github.io/Tracking-Anything-with-DEVA
引用
@article{arxiv.2309.03903,
title = {Tracking Anything with Decoupled Video Segmentation},
author = {Ho Kei Cheng and Seoung Wug Oh and Brian Price and Alexander Schwing and Joon-Young Lee},
journal= {arXiv preprint arXiv:2309.03903},
year = {2023}
}
备注
Accepted to ICCV 2023. Project page: https://hkchengrex.github.io/Tracking-Anything-with-DEVA