中文

用于行人意图预测的时空关系推理

计算机视觉与模式识别 2020-02-21 v1

摘要

对视觉数据进行推理是机器人和基于视觉的应用所期望具备的能力。此类推理能够实现对视频中下一事件或动作的预测。近年来,基于卷积操作开发了多种用于预测或预报的模型,但它们缺乏对时空数据进行推理并推断场景中不同物体之间关系的能力。在本文中,我们提出了一个基于图卷积的框架,以揭示场景中的时空关系,从而推理行人意图。场景图构建于视频帧内及跨视频帧的分割物体实例之上。行人意图,定义为穿越或不穿越街道的未来动作,是自动驾驶车辆安全且更平稳导航的极关键信息。我们从两个不同视角处理意图预测问题,并在以行人为中心和以位置为中心的场景中预测穿越意图。此外,我们引入了一个专为密集行人区域自动驾驶场景设计的新数据集:Stanford-TRI 意图预测(STIP)数据集。我们在 STIP 和另一个基准数据集上的实验表明,我们的图建模框架能够预测行人的穿越意图,在 STIP 上准确率为 79.10%,在 \rev{Joint Attention for Autonomous Driving (JAAD) dataset 上准确率为 79.28%,比实际穿越发生提前至多一秒。这些结果优于基线和先前工作。请参考 http://stip.stanford.edu/ 获取数据集和代码。

关键词

引用

@article{arxiv.2002.08945,
  title  = {Spatiotemporal Relationship Reasoning for Pedestrian Intent Prediction},
  author = {Bingbin Liu and Ehsan Adeli and Zhangjie Cao and Kuan-Hui Lee and Abhijeet Shenoi and Adrien Gaidon and Juan Carlos Niebles},
  journal= {arXiv preprint arXiv:2002.08945},
  year   = {2020}
}

备注

Accepted at ICRA 2020 and IEEE Robotics and Automation Letters