中文

面向鲁棒视频对象分割的自适应对象校准

计算机视觉与模式识别 2022-07-05 v1

摘要

在蓬勃发展的视频时代,视频分割在多媒体领域吸引了越来越多的研究关注。半监督视频对象分割(VOS)旨在给定参考帧的标注对象掩码后,分割视频中所有目标帧中的对象。大多数现有方法建立逐像素的参考-目标关联,然后执行逐像素跟踪以获得目标掩码。由于忽略对象级线索,像素级方法使跟踪易受扰动影响,甚至在相似对象间无法区分。为实现鲁棒 VOS,关键见解是校准每个特定对象的表示与掩码,使其具有表达性和判别性。相应地,我们提出一种新的深度网络,其能自适应构建对象表示并校准对象掩码以实现更强的鲁棒性。首先,我们通过自适应对象代理(AOP)聚合方法构建对象表示,其中代理在多层次上表示任意形状的参考片段。然后,基于 AOP 从参考-目标关联初步生成原型掩码。之后,此类原型掩码通过以对象代理表示为条件的网络调制被进一步校准。我们以渐进方式巩固该条件掩码校准过程,其中对象表示与原型掩码迭代演化以具备判别性。我们在标准 VOS 基准 YouTube-VOS-18/19 和 DAVIS-17 上进行了大量实验。我们的模型在已发表的现有工作中取得了最先进的性能,并且对扰动表现出优越的鲁棒性。我们的项目仓库位于 https://github.com/JerryX1110/Robust-Video-Object-Segmentation

关键词

引用

@article{arxiv.2207.00887,
  title  = {Towards Robust Video Object Segmentation with Adaptive Object Calibration},
  author = {Xiaohao Xu and Jinglu Wang and Xiang Ming and Yan Lu},
  journal= {arXiv preprint arXiv:2207.00887},
  year   = {2022}
}

备注

19 pages, 17 figures, ACM Multimedia 2022 Accepted