中文

让单样本视频目标分割再次高效

计算机视觉与模式识别 2020-12-04 v1 机器学习 机器人学

摘要

视频目标分割(VOS)描述在视频每一帧中分割一组对象的任务。在半监督设定下,每个对象的首帧掩码在测试时给出。遵循单样本原则,微调 VOS 方法在每个给定对象掩码上分别训练分割模型。然而,近来 VOS 领域认为此类测试时优化及其对测试运行时间的影响不可行。为缓解先前微调方法的低效,我们提出高效的单样本视频目标分割(e-OSVOS)。与多数 VOS 方法不同,e-OSVOS 解耦了目标检测任务,并通过应用修改版 Mask R-CNN 仅预测局部分割掩码。单样本测试运行时间与性能得到优化,无需繁琐且手工设计的超参数搜索。为此,我们元学习测试时优化的模型初始化与学习率。为获得最优学习行为,我们在神经元层级预测个体学习率。此外,我们应用在线适应,通过持续在先前掩码预测上微调模型并辅以帧间边界框传播,来解决序列中常见的性能退化。e-OSVOS 在 DAVIS 2016、DAVIS 2017 与 YouTube-VOS 上以单样本微调方法取得了最先进结果,同时大幅降低了测试运行时间。代码见 https://github.com/dvl-tum/e-osvos。

关键词

引用

@article{arxiv.2012.01866,
  title  = {Make One-Shot Video Object Segmentation Efficient Again},
  author = {Tim Meinhardt and Laura Leal-Taixe},
  journal= {arXiv preprint arXiv:2012.01866},
  year   = {2020}
}