用于视频场景理解的概率未来预测
计算机视觉与模式识别
2020-07-20 v2 机器学习
机器人学
摘要
我们提出一种用于视频概率未来预测的新型深度学习架构。我们预测复杂真实世界城市场景的未来语义、几何与运动,并利用该表示来控制自动驾驶车辆。本工作是首个以概率方式联合预测自运动、静态场景与动态智能体运动的方法,其允许从一个紧凑潜空间中采样一致且高概率的未来。我们的模型通过时空卷积模块从RGB视频中学习表示。所学表示除作为习得驾驶策略的输入外,还可被显式解码为未来的语义分割、深度与光流。为建模未来的随机性,我们引入一种条件变分方法,其最小化当前分布(基于已观测内容的可能发生)与未来分布(实际观测发生)之间的散度。在推理期间,通过从当前分布中采样生成多样化的未来。
引用
@article{arxiv.2003.06409,
title = {Probabilistic Future Prediction for Video Scene Understanding},
author = {Anthony Hu and Fergal Cotter and Nikhil Mohan and Corina Gurau and Alex Kendall},
journal= {arXiv preprint arXiv:2003.06409},
year = {2020}
}
备注
Accepted as a conference paper at ECCV 2020