中文

利用运动-表观协同改进无监督视频对象分割

计算机视觉与模式识别 2022-12-20 v1

摘要

我们提出IMAS,一种在训练或推理中无需人工标注即可分割视频中主要对象的方法。无监督视频对象分割(UVOS)的先前方法已证明运动作为分割的输入或监督的有效性。然而,在可变形对象和带反射对象等情况下,运动信号可能无信息量甚至具误导性,导致不满意的分割。相比之下,IMAS通过运动-表观协同实现了改进的UVOS。我们的方法有两个训练阶段:1)运动监督的对象发现阶段,通过可学习的残差路径处理运动-表观冲突;2)细化阶段,利用低层与高层表观监督纠正从误导性运动线索中学到的模型误解。此外,我们提出运动-语义对齐作为一种模型无关的免标注超参数调优方法。我们证明了其在调优先前依赖人工标注或手工设计的超参数专用指标调优的关键超参数上的有效性。IMAS在多个常见UVOS基准上大幅提升了分割质量。例如,仅使用标准ResNet和卷积头,我们在DAVIS16基准上以8.3%超越先前方法。我们拟发布代码以供未来研究与应用。

关键词

引用

@article{arxiv.2212.08816,
  title  = {Improving Unsupervised Video Object Segmentation with Motion-Appearance Synergy},
  author = {Long Lian and Zhirong Wu and Stella X. Yu},
  journal= {arXiv preprint arXiv:2212.08816},
  year   = {2022}
}

备注

15 pages, 10 figures