中文

学习分割运动物体

计算机视觉与模式识别 2017-12-05 v1

摘要

我们研究在无约束视频中分割运动物体的问题。给定一段视频,任务是分割出在至少一帧中表现出独立运动的全部物体。我们将此表述为一个学习问题,并设计了融合三种线索的框架:(i) 帧对之间的独立物体运动,其补充了物体识别;(ii) 物体外观,其有助于纠正运动估计中的错误;(iii) 时间一致性,其对分割施加额外约束。该框架是一个带显式记忆模块的双流神经网络。两条流分别编码视频序列中的外观与运动线索,而记忆模块利用时间一致性捕捉物体随时间的演化。运动流是一个在合成视频上训练的卷积神经网络,用于在光流场中分割独立运动的物体。用于构建视频中“视觉记忆”(即所有视频帧的联合表示)的模块由从少量训练视频序列中学习到的卷积循环单元实现。对于测试视频某一帧中的每个像素,我们的方法基于学到的时空特征以及该视频特有的“视觉记忆”赋予物体或背景标签。我们在三个基准 DAVIS、Freiburg-Berkeley 运动分割数据集和 SegTrack 上广泛评估了我们的方法。此外,我们提供了详尽的消融研究,以考察训练数据的选择以及所提框架中各个组件的影响。

关键词

引用

@article{arxiv.1712.01127,
  title  = {Learning to Segment Moving Objects},
  author = {Pavel Tokmakov and Cordelia Schmid and Karteek Alahari},
  journal= {arXiv preprint arXiv:1712.01127},
  year   = {2017}
}

备注

arXiv admin note: text overlap with arXiv:1704.05737, arXiv:1612.07217