中文

面向自监督视频分割的统一掩码嵌入与对应学习

计算机视觉与模式识别 2023-03-20 v1

摘要

本文的目标是视频目标分割的自监督学习。我们提出一个统一框架,同时建模用于局部判别特征学习的跨帧稠密对应,并嵌入目标级上下文以解码目标掩码。因此,与以往通常依赖间接方案——依据像素级相关性廉价地“复制”标签——的努力不同,该框架能够直接从无标签视频中学习执行掩码引导的序列分割。具体而言,我们的算法交替进行:i) 对视频像素聚类以从无到有地创建伪分割标签;以及 ii) 利用伪标签学习用于 VOS 的掩码编码与解码。无监督对应学习进一步被整合进这一自教式的掩码嵌入方案中,以确保所学表示的通用性并避免聚类退化。我们的算法在两个标准基准(即 DAVIS17 与 YouTube-VOS)上取得了 SOTA 性能,在性能与网络架构设计上均缩小了自监督与全监督 VOS 之间的差距。

关键词

引用

@article{arxiv.2303.10100,
  title  = {Unified Mask Embedding and Correspondence Learning for Self-Supervised Video Segmentation},
  author = {Liulei Li and Wenguan Wang and Tianfei Zhou and Jianwu Li and Yi Yang},
  journal= {arXiv preprint arXiv:2303.10100},
  year   = {2023}
}

备注

CVPR 2023. code: https://github.com/0liliulei/Mask-VOS