中文

自监督非模态视频对象分割

计算机视觉与模式识别 2022-10-25 v1

摘要

非模态感知需要推断被部分遮挡对象的完整形状。该任务在两个层面上尤其具有挑战性:(1)它需要比瞬时视网膜或成像传感器所包含更多的信息;(2)难以获得足够带良好标注的非模态标签用于监督。为此,本文提出一种自监督非模态视频对象分割(SaVos)新框架。我们的方法高效利用视频时间序列的视觉信息来推断对象的非模态掩码。关键直觉在于,若对象被遮挡部分在其他帧中可见(只要形变可被合理学习,允许其发生形变),则该部分可被解释掉。相应地,我们推导出一种新颖的自监督学习范式,高效利用可见对象部分作为监督来引导视频上的训练。除学习已知类型的完整掩码的类型先验外,SaVos 还学习时空先验,其同样有助于非模态任务并可泛化至未见类型。所提框架在合成非模态分割基准 FISHBOWL 与真实世界基准 KINS-Video-Car 上取得最先进性能。此外,它很适合通过测试时自适应迁移至新分布,即使在迁移到新分布后也优于现有模型。

关键词

引用

@article{arxiv.2210.12733,
  title  = {Self-supervised Amodal Video Object Segmentation},
  author = {Jian Yao and Yuxin Hong and Chiyu Wang and Tianjun Xiao and Tong He and Francesco Locatello and David Wipf and Yanwei Fu and Zheng Zhang},
  journal= {arXiv preprint arXiv:2210.12733},
  year   = {2022}
}

备注

accepted in Neurips2022