中文

视觉引导预测——多步长时间序列预测的视觉上下文

计算机视觉与模式识别 2021-09-28 v2 机器学习

摘要

由于改变通勤方式的潜力,自动驾驶近年来获得了巨大关注。人们已投入大量努力试图估计车辆的状态。同时,学习预测前方车辆的状态引入了新能力,例如预测危险情况。此外,通过学会预测由多个时间步长表达的更丰富上下文,预测带来了新的监督机会。直观上,源自前置摄像头的视频流是必要的,因为它编码了关于前方道路的信息。此外,车辆状态的历史轨迹提供了更多上下文。在本文中,我们通过融合这两种模态来解决车辆状态的多步长预测问题。我们设计并用3种端到端架构进行实验,这些架构利用3D卷积提取视觉特征,并利用1D卷积从速度和转向角轨迹中提取特征。为证明我们方法的有效性,我们在两个公开可用的真实世界数据集Comma2k19和Udacity challenge上进行了广泛实验。我们表明能够预测车辆状态至不同步长,同时在相关驾驶状态估计任务上优于当前最先进结果。我们考察了视觉特征的贡献,发现喂入视觉特征的模型在Udacity和Comma2k19数据集上分别仅达到未使用这些特征的模型误差的56.6%和66.9%。

关键词

引用

@article{arxiv.2107.12674,
  title  = {Vision-Guided Forecasting -- Visual Context for Multi-Horizon Time Series Forecasting},
  author = {Eitan Kosman and Dotan Di Castro},
  journal= {arXiv preprint arXiv:2107.12674},
  year   = {2021}
}

备注

To be presented in the ROAD challenge & SRVU workshop (ICCV2021)