中文

视频实例抠图

计算机视觉与模式识别 2023-11-09 v2

摘要

传统的视频抠图对视频帧中出现的所有实例输出一张 alpha 抠图,从而无法区分各个实例。尽管视频实例分割提供了时间一致的实例掩码,但其结果对于抠图应用而言并不理想,尤其是由于所施加的二值化。为弥补这一缺陷,我们提出视频实例抠图(VIM),即估计视频序列每一帧中每个实例的 alpha 抠图。为应对这一挑战性问题,我们提出 MSG-VIM,一种掩码序列引导的视频实例抠图神经网络,作为 VIM 的新型基线模型。MSG-VIM 利用混合掩码增强,使预测对不准确和不一致的掩码引导具有鲁棒性。它结合时间掩码与时间特征引导,以改善 alpha 抠图预测的时间一致性。此外,我们为 VIM 构建了一个名为 VIM50 的新基准,包含 50 个以多个人类实例为前景物体的视频片段。为评估 VIM 任务上的性能,我们引入了一种合适的度量称为视频实例感知抠图质量(VIMQ)。我们提出的模型 MSG-VIM 在 VIM50 基准上确立了强基线,并以大幅优势超越现有方法。该项目已开源:https://github.com/SHI-Labs/VIM。

关键词

引用

@article{arxiv.2311.04212,
  title  = {Video Instance Matting},
  author = {Jiachen Li and Roberto Henschel and Vidit Goel and Marianna Ohanyan and Shant Navasardyan and Humphrey Shi},
  journal= {arXiv preprint arXiv:2311.04212},
  year   = {2023}
}