中文

基于预测特征学习的视频场景解析

计算机视觉与模式识别 2016-12-14 v2

摘要

在这项工作中,我们通过开发在有限解析标注下的有效表示学习方法来解决具有挑战性的视频场景解析问题。特别地,我们贡献了两种构成统一解析框架的新方法。(1) 来自近乎无限的无标注视频数据的预测特征学习。与现有从单帧解析学习特征的方法不同,我们通过强制解析网络在仅给定历史帧的情况下预测未来帧及其解析图(若可用),来学习时空判别特征。这样,网络能有效学会捕捉视频动态和时间上下文,这些是视频场景解析的关键线索,且无需额外人工标注。(2) 预测引导解析架构,其将学习到的时空特征有效适配于场景解析任务,并为任何现成的解析模型提供强有力指导,以实现更好的视频场景解析性能。在两个具挑战性数据集 Cityscapes 和 Camvid 上的大量实验表明,我们的方法相较成熟的基线有显著提升,从而证明了其有效性。

关键词

引用

@article{arxiv.1612.00119,
  title  = {Video Scene Parsing with Predictive Feature Learning},
  author = {Xiaojie Jin and Xin Li and Huaxin Xiao and Xiaohui Shen and Zhe Lin and Jimei Yang and Yunpeng Chen and Jian Dong and Luoqi Liu and Zequn Jie and Jiashi Feng and Shuicheng Yan},
  journal= {arXiv preprint arXiv:1612.00119},
  year   = {2016}
}

备注

15 pages, 7 figures, 5 tables, currently v2