基于单目视频的行人动作识别与三维定位
计算机视觉与模式识别
2021-01-25 v1
摘要
理解和预测行人行为是实现城市场景中自动化与高级驾驶辅助技术安全有效导航策略的一个重要且具挑战性的研究领域。本文关注以自我为中心视角下的单目行人动作识别与三维定位,旨在预测意图并预报未来轨迹。在城市交通场景中解决该问题的挑战源于行人行为的不可预测性,即动作与意图不断变动,并取决于行人姿态、其三维空间关系以及与其他智能体和环境的交互。为部分应对这些挑战,我们考虑姿态对行人动作识别与三维定位的重要性。特别地,我们提出一种使用双流时间关系网络的动作识别框架,其输入对应于被跟踪行人的原始 RGB 图像序列以及行人姿态。基于 JAAD 公开数据集的评估表明,所提方法优于使用单流时间关系网络的方法。估计的姿态及相应身体关键点也作为网络输入,该网络利用独特的损失函数估计行人的三维位置。在 KITTI 数据集上对我们三维定位方法的评估表明,与现有最先进方法相比平均定位误差有所改善。最后,我们在 HRI 的 H3D 驾驶数据集上进行了动作识别与三维定位的定性测试。
引用
@article{arxiv.2008.01162,
title = {Recognition and 3D Localization of Pedestrian Actions from Monocular Video},
author = {Jun Hayakawa and Behzad Dariush},
journal= {arXiv preprint arXiv:2008.01162},
year = {2021}
}