中文

用于多智能体运动预测的动态与静态上下文感知 LSTM

计算机视觉与模式识别 2020-08-04 v1

摘要

多智能体运动预测具有挑战性,因为它旨在同时预见复杂场景中多个智能体(例如行人)的未来轨迹。现有工作通过要么学习由一组行人的位置所表示的社会空间交互(而忽略其时间一致性,即不同长轨迹之间的依赖关系),要么通过理解复杂场景布局(例如场景分割)以确保安全导航来应对这一挑战。然而,与先前将空间交互、时间一致性和场景布局孤立处理的工作不同,本文设计了一种新机制,即动态与静态上下文感知运动预测器(DSCMP),将这些丰富信息整合进长短期记忆(LSTM)中。它具有三个显著优势。(1)DSCMP 通过学习智能体的空间位置和时间一致性以及理解上下文场景布局来建模智能体之间的动态交互。(2)与以往通过逐帧传播隐藏特征来预测运动的 LSTM 模型不同(这限制了学习长轨迹之间相关性的能力),我们在 DSCMP 中精心设计了可微分队列机制,能够显式记忆并学习长轨迹之间的相关性。(3)DSCMP 通过推断潜变量来捕获场景上下文,从而实现具有有意义语义场景布局的多模态预测。大量实验表明,DSCMP 大幅优于最先进的方法,例如在 ETH-UCY 和 SDD 数据集上分别取得 9.05% 和 7.62% 的相对提升。

关键词

引用

@article{arxiv.2008.00777,
  title  = {Dynamic and Static Context-aware LSTM for Multi-agent Motion Prediction},
  author = {Chaofan Tao and Qinhong Jiang and Lixin Duan and Ping Luo},
  journal= {arXiv preprint arXiv:2008.00777},
  year   = {2020}
}

备注

17 pages, 6 figures