中文

动态静态混合:自监督视频对象分割中的视觉对应框架

计算机视觉与模式识别 2024-04-23 v1

摘要

传统的视频对象分割(VOS)方法通常需要大量像素级标注视频数据进行完全监督学习。本文提出了 HVC,即一种用于自监督 VOS 的混合静态动态视觉对应框架(Hybrid Visual Correspondence)。HVC 从静态图像中提取伪动态信号,实现高效且可扩展的 VOS 模型。我们的方法采用简约的全卷积架构来捕获图像裁剪视图中的静态动态视觉对应。为此,我们提出了统一的自监督方法,用于学习静态动态特征相似性的视觉表征。首先,我们利用裁剪视图之间先验坐标信息建立静态对应,以引导形成一致的静态特征表征。随后,我们设计了一个简洁的卷积层来捕获两个视图之间的前向/后向伪动态信号,作为动态表征的线索。最后,我们提出了混合视觉对应损失,用于学习联合静态和动态一致性表征。我们的方法无需复杂设计,仅需使用静态图像数据进行一次训练,显著降低了内存消耗(约 16GB)和训练时间(约 2 小时)。此外,HVC 在多个自监督 VOS 基准及其他视频标签传播任务中实现了最佳性能。

关键词

引用

@article{arxiv.2404.13505,
  title  = {Dynamic in Static: Hybrid Visual Correspondence for Self-Supervised Video Object Segmentation},
  author = {Gensheng Pei and Yazhou Yao and Jianbo Jiao and Wenguan Wang and Liqiang Nie and Jinhui Tang},
  journal= {arXiv preprint arXiv:2404.13505},
  year   = {2024}
}