中文

面向驾驶场景表征学习的视觉运动理解

计算机视觉与模式识别 2019-09-17 v1

摘要

行车记录仪每天捕获大量驾驶场景视频。这些视频有意地与车辆传感数据(如来自速度计和惯性传感器的数据)相耦合,从而免费提供了额外的传感模态。在这项工作中,我们利用大规模无标签但自然配对的数据进行驾驶场景中的视觉表征学习。表征在一个端到端自监督框架中学习,用于从带有配对传感数据的单帧预测稠密光流。我们假定该任务的成功需要网络在自我中心视角下学习语义和几何知识。例如,预测移动车辆将看到的未来视图需要理解场景深度、尺度以及物体的运动。我们证明,我们学到的表征可以有益于其他需要详细场景理解的任务,并在语义分割上优于其他竞争性的无监督表征。

关键词

引用

@article{arxiv.1909.06979,
  title  = {Visuomotor Understanding for Representation Learning of Driving Scenes},
  author = {Seokju Lee and Junsik Kim and Tae-Hyun Oh and Yongseop Jeong and Donggeun Yoo and Stephen Lin and In So Kweon},
  journal= {arXiv preprint arXiv:1909.06979},
  year   = {2019}
}

备注

BMVC 2019. Supplementary material: https://bmvc2019.org/wp-content/uploads/papers/0002-supplementary.zip Dataset: http://github.com/SeokjuLee/driving-dataset-doc