从视频中通过松弛共同命运与视觉分组自举目标性
计算机视觉与模式识别
2023-04-18 v1
摘要
我们研究从未标注视频中学习目标分割。人类能够轻松分割运动物体而不需要知道它们是什么。格式塔共同命运定律,即具有相同速度运动的事物属于一体,启发了基于运动分割的无监督目标发现。然而,共同命运并非目标性的可靠指标:铰接/可变形物体的部分可能不以相同速度运动,而物体的阴影/倒影总是与之同步运动却不属于物体本身。我们的洞见是,首先通过松弛共同命运学习图像特征,然后基于图像内部及跨图像统计上的视觉外观分组对其进行细化,从而自举目标性。具体而言,我们首先在以下循环中学习图像分割器:用恒定片段光流加片段内微小残差光流来近似光流,随后通过细化使其具有更连贯的外观和统计前景-背景相关性。在无监督视频目标分割任务上,仅使用 ResNet 和卷积头,我们的模型在 DAVIS16 / STv2 / FBMS59 上分别以绝对增益 7%/9%/5% 超越当前最优(SOTA),证明了我们方法的有效性。我们的代码已公开。
引用
@article{arxiv.2304.08025,
title = {Bootstrapping Objectness from Videos by Relaxed Common Fate and Visual Grouping},
author = {Long Lian and Zhirong Wu and Stella X. Yu},
journal= {arXiv preprint arXiv:2304.08025},
year = {2023}
}
备注
Accepted by CVPR 2023. An extension of preprint 2212.08816. 19 pages, 11 figures