从以对象为中心表征的学习监督信号重新思考视频遮挡分割
计算机视觉与模式识别
2023-09-26 v1
摘要
视频遮挡分割是计算机视觉中一项极具挑战性的任务,需要从物体的可见部分推断出其完整形状。近来,一些研究在自监督设定下利用运动流跨帧整合信息,取得了有前景的性能。然而,运动流受移动相机和物体形变两个因素的明显限制。本文对先前工作进行了重新思考。我们特别利用真实世界场景中以对象为中心的表征所提供的监督信号。其底层思想是,特定物体的监督信号与来自不同视角特征可相互裨益,从而在任何特定帧中推断完整掩码。因此我们提出了一种高效的以对象为中心表征遮挡分割方法(EoRaS)。特别地,除仅依赖监督信号外,我们设计了一个转换模块将图像特征投影到鸟瞰图(BEV),引入 3D 信息以提升当前特征质量。此外,我们提出了一种基于多视角融合层的时间模块,该模块配备一组对象槽,并通过注意力机制与来自不同视角的特征交互,以实现充分的对象表征补全。因此,物体的完整掩码可由对象槽更新后的图像特征解码得到。在真实世界与合成基准上的大量实验证明了我们所提方法的优越性,取得了最先进的性能。我们的代码将发布于 \url{https://github.com/kfan21/EoRaS}。
引用
@article{arxiv.2309.13248,
title = {Rethinking Amodal Video Segmentation from Learning Supervised Signals with Object-centric Representation},
author = {Ke Fan and Jingshi Lei and Xuelin Qian and Miaopeng Yu and Tianjun Xiao and Tong He and Zheng Zhang and Yanwei Fu},
journal= {arXiv preprint arXiv:2309.13248},
year = {2023}
}
备注
Accepted by ICCV 2023