用于稠密无监督视频分割的内外生成式学习
计算机视觉与模式识别
2022-10-25 v4
摘要
本文关注视频对象分割(VOS)的无监督学习,其从未标注视频中学习视觉对应(即像素级特征之间的相似性)。先前方法主要基于对比学习范式,在图像级或像素级进行优化。图像级优化(如 ResNet 的空间池化特征)学习到鲁棒的高层语义,但由于像素级特征是隐式优化的,因而并非最优。相比之下,像素级优化更为显式,然而其对训练数据的视觉质量敏感,且对对象形变不够鲁棒。为在统一框架中互补地执行这两个层级的优化,我们从纯生成式视角提出了 In-aNd-Out(INO)生成式学习,借助 Vision Transformer(ViT)中自然设计的类令牌与块令牌。具体而言,对于图像级优化,我们强制类令牌上从局部视图到全局视图的外视想象,有助于捕获高层语义,称之为外生成式学习。至于像素级优化,我们对块令牌执行视图内掩码图像建模,通过推断图像的细粒度结构来恢复损坏部分,称之为内生成式学习。为更好地发掘时间信息,我们额外在特征与亲和矩阵两个层级上强制帧间一致性。在 DAVIS-2017 val 与 YouTube-VOS 2018 val 上的大量实验表明,我们的 INO 以显著优势超越先前的最先进方法。代码见:https://github.com/pansanity666/INO_VOS
引用
@article{arxiv.2203.15312,
title = {In-N-Out Generative Learning for Dense Unsupervised Video Segmentation},
author = {Xiao Pan and Peike Li and Zongxin Yang and Huiling Zhou and Chang Zhou and Hongxia Yang and Jingren Zhou and Yi Yang},
journal= {arXiv preprint arXiv:2203.15312},
year = {2022}
}
备注
Accepted by ACM MM 2022