中文

基于对比运动聚类的在线无监督视频对象分割

计算机视觉与模式识别 2024-01-18 v3

摘要

在线无监督视频对象分割(UVOS)利用先前帧作为输入,自动从流式视频中分离主要对象,而无需使用任何进一步的人工标注。一个主要挑战在于模型无法访问未来帧,必须仅依赖历史信息,即分割掩码在捕获当前帧后立即由其预测得出。本工作中,利用视觉元素若具有相同运动模式则往往被感知为一组的共同命运原则,提出了一种以光流为输入、用于在线 UVOS 的新颖对比运动聚类算法。我们构建了一个简单有效的自编码器,以迭代方式归纳非可学习的运动模式原型基,而这些基反过来有助于学习嵌入网络的表征。此外,开发了一种基于边界先验的对比学习策略,以在表征学习阶段改善前景与背景特征的判别性。所提算法可在任意尺度数据(即帧、片段、数据集)上优化,并以在线方式运行。在 DAVIS16\textit{DAVIS}_{\textit{16}}FBMS\textit{FBMS}SegTrackV2\textit{SegTrackV2} 数据集上的实验表明,我们的方法精度分别超越先前最先进(SoTA)在线 UVOS 方法 0.8%、2.9% 和 1.1%。此外,通过使用在线深度子空间聚类处理运动分组,我们的方法相较于 SoTA 在线 UVOS 方法能以 3×3\times 更快的推理时间取得更高精度,并在效果与效率间取得良好权衡。我们的代码见 https://github.com/xilin1991/ClusterNet。

关键词

引用

@article{arxiv.2306.12048,
  title  = {Online Unsupervised Video Object Segmentation via Contrastive Motion Clustering},
  author = {Lin Xi and Weihai Chen and Xingming Wu and Zhong Liu and Zhengguo Li},
  journal= {arXiv preprint arXiv:2306.12048},
  year   = {2024}
}

备注

Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)