基于运动分组的自监督视频对象分割
计算机视觉与模式识别
2021-08-12 v2 机器学习
摘要
动物进化出了高度功能化的视觉系统来理解运动,即使在复杂环境下也能辅助感知。在本文中,我们致力于开发一种能够利用运动线索分割对象的计算机视觉系统,即运动分割。我们做出如下贡献:首先,我们引入 Transformer 的一个简单变体,将光流帧分割为主要对象与背景。其次,我们以自监督方式训练该架构,即不使用任何人工标注。第三,我们分析了方法的几个关键组件并进行了彻底的消融研究以验证其必要性。第四,我们在公开基准(DAVIS2016、SegTrackv2 和 FBMS59)上评估所提架构。尽管仅以光流作为输入,我们的方法取得了优于或可与先前最先进自监督方法相比的结果,同时速度快一个数量级。我们还在具有挑战性的伪装数据集(MoCA)上进行了评估,显著优于其他自监督方法,并与顶尖监督方法表现相当,突出了运动线索的重要性,以及现有视频分割模型中可能存在的对视觉外观的偏置。
引用
@article{arxiv.2104.07658,
title = {Self-supervised Video Object Segmentation by Motion Grouping},
author = {Charig Yang and Hala Lamdouar and Erika Lu and Andrew Zisserman and Weidi Xie},
journal= {arXiv preprint arXiv:2104.07658},
year = {2021}
}
备注
Best Paper in CVPR2021 RVSU Workshop. Accepted by ICCV