中文

InstMove:面向以物体为中心视频分割的实例运动方法

计算机视觉与模式识别 2023-03-31 v2

摘要

尽管付出了巨大努力,前沿视频分割方法仍对遮挡与快速运动敏感,因其依赖以物体嵌入形式呈现的物体表观,而后者易受此类干扰。一种常见解是使用光流提供运动信息,但其本质上仅考虑像素级运动,仍依赖表观相似性,因此在遮挡与快速运动下常不准确。本工作中,我们研究实例级运动并提出InstMove,即面向以物体为中心视频分割的实例运动(Instance Motion for Object-centric Video Segmentation)。相较于像素级运动,InstMove主要依赖不受图像特征嵌入影响的实例级运动信息,且具有物理解释性,使其在遮挡与快速运动物体下更准确稳健。为更好契合视频分割任务,InstMove利用实例掩码建模物体的物理存在,并通过记忆网络学习动态模型以预测其在下一帧的位置与形状。仅需数行代码,InstMove便可集成进当前SOTA方法以用于三种不同视频分割任务并提升其性能。具体而言,我们在以重度遮挡为特征的OVIS数据集上以1.5 AP改进先前最优,在主要以快速运动物体为主的YouTubeVIS-Long数据集上以4.9 AP改进。这些结果表明实例级运动稳健且准确,从而可作为以物体为中心视频分割在复杂场景中的有力方案。

关键词

引用

@article{arxiv.2303.08132,
  title  = {InstMove: Instance Motion for Object-centric Video Segmentation},
  author = {Qihao Liu and Junfeng Wu and Yi Jiang and Xiang Bai and Alan Yuille and Song Bai},
  journal= {arXiv preprint arXiv:2303.08132},
  year   = {2023}
}

备注

Accepted to CVPR 2023; Code: https://github.com/wjf5203/VNext