面向无监督视频多目标分割的目标感知物体发现与关联
计算机视觉与模式识别
2021-04-13 v1
摘要
本文解决无监督视频多目标分割任务。当前方法遵循两阶段范式:1)使用预训练的 Mask R-CNN 检测物体提议,2)利用重识别技术进行通用特征匹配的时序关联。然而,两个阶段广泛使用的通用特征对于刻画未见物体并不可靠,导致泛化能力差。为此,我们引入一种新方法以实现更准确高效的时空分割。具体而言,针对实例判别,我们提出将前景区域估计与实例分组结合于同一网络中,并额外引入时序引导以分割每帧,从而实现更准确的物体发现。针对时序关联,我们用一个判别性外观模型补充当前的视频目标分割架构,该模型能够捕获更细粒度的目标特定信息。给定来自实例判别网络的物体提议,采用三种关键策略以实现准确分割:1)使用记忆增强外观模型进行目标特定跟踪;2)目标无关验证以追踪该提议可能的轨迹段;3)利用已验证片段进行自适应记忆更新。我们在 DAVIS 和 YouTube-VIS 上评估所提方法,结果表明其在分割精度与推理速度上均优于 SOTA 方法。
引用
@article{arxiv.2104.04782,
title = {Target-Aware Object Discovery and Association for Unsupervised Video Multi-Object Segmentation},
author = {Tianfei Zhou and Jianwu Li and Xueyi Li and Ling Shao},
journal= {arXiv preprint arXiv:2104.04782},
year = {2021}
}
备注
CVPR21