DESIRE:动态场景中交互智能体的远期未来预测
计算机视觉与模式识别
2017-04-17 v1
摘要
我们提出了一种深度随机 IOC RNN 编解码器框架 DESIRE,用于动态场景中多个交互智能体的未来预测任务。DESIRE 通过以下方式有效预测多场景中物体的未来位置:1) 考虑未来预测的多模态性质(即给定相同上下文,未来可能变化);2) 预见潜在的未来结果并据此做出策略性预测;3) 不仅根据过去运动历史,还根据场景上下文以及智能体之间的交互进行推理。DESIRE 在单一端到端可训练神经网络模型中实现这些,同时计算高效。该模型首先利用条件变分自编码器获得一组多样的假设未来预测样本,随后由后续的 RNN 评分-回归模块对其进行排序与精炼。样本通过考虑累积未来奖励来评分,从而实现类似于 IOC 框架的更好的长期策略决策。一个 RNN 场景上下文融合模块联合捕获过去运动历史、语义场景上下文以及多个智能体间的交互。反馈机制在排序与精炼上迭代以进一步提升预测精度。我们在两个公开数据集 KITTI 与 Stanford Drone Dataset 上评估我们的模型。实验表明,相较于其他基线方法,所提模型显著提升了预测精度。
引用
@article{arxiv.1704.04394,
title = {DESIRE: Distant Future Prediction in Dynamic Scenes with Interacting Agents},
author = {Namhoon Lee and Wongun Choi and Paul Vernaza and Christopher B. Choy and Philip H. S. Torr and Manmohan Chandraker},
journal= {arXiv preprint arXiv:1704.04394},
year = {2017}
}
备注
Accepted at CVPR 2017