中文

从视频整体理解道路布局

计算机视觉与模式识别 2020-07-03 v1

摘要

本文研究从视频序列推断复杂道路场景布局的问题。为此,我们将其表述为俯视道路属性预测问题,目标是为每一帧准确且一致地预测这些属性。与先前工作不同,我们利用了以下三个新颖方面:利用视频中的相机运动、包含上下文线索以及融合长期视频信息。具体而言,我们引入了一个旨在增强视频中预测一致性的模型。我们的模型由一个LSTM和一个特征变换模块(FTM)组成。前者通过其隐藏状态隐式地融入一致性约束,后者在沿视频聚合信息时显式地考虑相机运动。此外,我们提出通过引入道路参与者(如物体)到模型中以融合上下文信息。当整个视频序列可用时,我们的模型还能够编码局部与全局线索,例如来自过去与未来帧的信息。在两个数据集上的实验表明:(1) 融合全局或上下文线索均可提升预测精度,而同时利用两者可获得最佳性能。(2) 引入LSTM和FTM模块改善了视频中的预测一致性。(3) 所提方法大幅优于SOTA。

关键词

引用

@article{arxiv.2007.00822,
  title  = {Understanding Road Layout from Videos as a Whole},
  author = {Buyu Liu and Bingbing Zhuang and Samuel Schulter and Pan Ji and Manmohan Chandraker},
  journal= {arXiv preprint arXiv:2007.00822},
  year   = {2020}
}

备注

CVPR 2020