中文

为视频实例分割的在线模型辩护

计算机视觉与模式识别 2022-07-22 v1

摘要

近年来,视频实例分割(VIS)在很大程度上由离线模型推进,而在线模型可能因性能不佳逐渐受较少关注。然而,在线方法在处理长视频序列与进行中视频方面具有固有优势,而离线模型受计算资源限制无法做到。因此,若在线模型能达到与离线模型相当甚至更优的性能,将非常可取。通过剖析当前在线与离线模型,我们表明性能差距的主因是特征空间中不同实例因外观相似导致的帧间易错关联。观察到此,我们提出一种基于对比学习的在线框架,能够学习更具判别力的实例嵌入用于关联,并充分利用历史信息以提升稳定性。尽管简单,我们的方法在三个基准上优于所有在线与离线方法。具体而言,我们在 YouTube-VIS 2019 上取得 49.5 AP,较先前在线与离线最优分别显著提升 13.2 AP 与 2.1 AP。此外,我们在更具挑战性、存在显著拥挤与遮挡的 OVIS 上取得 30.2 AP,超越先前最优 14.8 AP。所提方法在第四届大规模视频目标分割挑战赛(CVPR2022)的视频实例分割赛道获得第一名。我们希望方法的简洁有效性,以及对当前方法的洞察,能为 VIS 模型的探索提供启示。

关键词

引用

@article{arxiv.2207.10661,
  title  = {In Defense of Online Models for Video Instance Segmentation},
  author = {Junfeng Wu and Qihao Liu and Yi Jiang and Song Bai and Alan Yuille and Xiang Bai},
  journal= {arXiv preprint arXiv:2207.10661},
  year   = {2022}
}

备注

ECCV 2022, Oral