中文

语义与时序对应相结合:视频中以对象为中心的自我监督学习

计算机视觉与模式识别 2024-03-22 v2

摘要

自我监督方法在学习高层语义与低层时序对应方面已取得显著进展。基于这些结果,我们更进一步,探索融合这两类特征以增强以对象为中心的表征的可能性。我们的初步实验表明,查询槽注意力可从 RGB 特征图中提取不同的语义成分,而基于随机采样的槽注意力可利用帧间的时序对应线索来辅助实例识别。受此启发,我们在融合的语义特征与对应图上提出了一种新颖的语义感知掩码槽注意力。它包含两级槽注意力,并带有一组共享的可学习高斯分布。在第一阶段,我们使用均值向量作为槽初始化,以分解潜在语义并通过迭代注意力生成语义分割掩码。在第二阶段,对于每一语义,我们从相应的高斯分布中随机采样槽,并在语义区域内执行掩码特征聚合,以利用时序对应模式进行实例识别。我们采用语义级与实例级的时序一致性作为自我监督,以鼓励时间上连贯的以对象为中心的表征。我们的模型能有效识别具有语义结构的多个对象实例,在无监督视频对象发现上取得了有前景的结果。此外,我们在稠密标签传播任务上达到了最先进的性能,展示了以对象为中心分析的潜力。代码发布于 https://github.com/shvdiwnkozbw/SMTC。

关键词

引用

@article{arxiv.2308.09951,
  title  = {Semantics Meets Temporal Correspondence: Self-supervised Object-centric Learning in Videos},
  author = {Rui Qian and Shuangrui Ding and Xian Liu and Dahua Lin},
  journal= {arXiv preprint arXiv:2308.09951},
  year   = {2024}
}

备注

ICCV 2023