中文

匹配之前先看一看:实例理解在视频对象分割中的关键作用

计算机视觉与模式识别 2022-12-14 v1

摘要

通过探索当前帧与过去帧之间的稠密匹配以进行长程上下文建模,基于记忆的方法近年来在视频对象分割(VOS)中展现了令人印象深刻的结果。然而,由于缺乏实例理解能力,上述方法往往对由对象和相机运动引起的大幅外观变化或视角变化十分脆弱。在本文中,我们认为实例理解在 VOS 中至关重要,将其与基于记忆的匹配相结合可发挥协同作用,这从 VOS 任务的定义(即在视频中识别并分割对象实例)来看是直观合理的。为此,我们提出了一个用于 VOS 的双分支网络,其中基于查询的实例分割(IS)分支深入挖掘当前帧的实例细节,VOS 分支与记忆库进行时空匹配。我们利用 IS 分支中良好学习的对象查询将实例特定信息注入查询键,并进一步执行实例增强的匹配。此外,我们引入了多路径融合模块,以有效结合来自实例分割解码器的记忆读出与多尺度特征,从而融入高分辨率实例感知特征以生成最终分割结果。我们的方法在 DAVIS 2016/2017 val(92.6% 和 87.1%)、DAVIS 2017 test-dev(82.8%)以及 YouTube-VOS 2018/2019 val(86.3% 和 86.3%)上取得了最先进的性能,以明显优势超越其他替代方法。

关键词

引用

@article{arxiv.2212.06826,
  title  = {Look Before You Match: Instance Understanding Matters in Video Object Segmentation},
  author = {Junke Wang and Dongdong Chen and Zuxuan Wu and Chong Luo and Chuanxin Tang and Xiyang Dai and Yucheng Zhao and Yujia Xie and Lu Yuan and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2212.06826},
  year   = {2022}
}