学习推荐帧用于野外部景中的交互式视频对象分割
计算机视觉与模式识别
2021-06-18 v2
摘要
本文提出了一种用于野外部景中交互式视频对象分割(VOS)的框架,其中用户可迭代地选择一些帧进行标注。然后,基于用户标注,分割算法细化掩码。先前的交互式 VOS 范式选择具有某些最差评估度量的帧,并且需要真值来计算该评估度量,这在测试阶段是不切实际的。相反,在本文中,我们认为具有最差评估度量的帧可能并非恰好是能带来整个视频最大性能提升的最具价值帧。因此,我们将交互式 VOS 中的帧选择问题公式化为一个马尔可夫决策过程,其中在深度强化学习框架下学习一个智能体来推荐帧。学习到的智能体可自动确定最具价值的帧,使交互式设置在实际野外部景中更实用。在公开数据集上的实验结果表明,我们的学习智能体在不改变底层 VOS 算法的情况下是有效的。我们的数据、代码和模型可在 https://github.com/svip-lab/IVOS-W 获取。
引用
@article{arxiv.2103.10391,
title = {Learning to Recommend Frame for Interactive Video Object Segmentation in the Wild},
author = {Zhaoyuan Yin and Jia Zheng and Weixin Luo and Shenhan Qian and Hanling Zhang and Shenghua Gao},
journal= {arXiv preprint arXiv:2103.10391},
year = {2021}
}
备注
To appear in CVPR 2021. Minor revision