中文

融合社会与场景上下文的人体运动与姿态预测

计算机视觉与模式识别 2020-07-15 v1

摘要

在与人类交互时实现平滑无缝的机器人导航依赖于对人体运动的预测。此类人体动态的预测通常涉及对人体轨迹(全局运动)或精细身体关节运动(局部运动)的建模。先前工作通常分别处理局部与全局人体运动。本文中,我们提出一种新颖框架,以统一的端到端流程同时解决人体运动(或轨迹)与身体骨骼姿态预测两项任务。为应对该现实问题,我们将场景与社会上下文作为该预测任务的关键线索纳入所提框架。为此,我们首先通过 i) 使用共享的门控循环单元 (GRU) 编码器编码其历史,以及 ii) 应用一种度量作为损失,该度量将各任务误差来源联合度量为单一距离,来耦合这两项任务。随后,我们通过编码视频数据的时空表示来融入场景上下文。我们还利用社会池化层从场景中所有人的运动与姿态生成联合特征表示,从而引入社会线索。最后,我们使用基于 GRU 的解码器来预测运动与骨骼姿态。我们证明所提框架在两个社会数据集上相较若干基线取得了更优性能。

关键词

引用

@article{arxiv.2007.06843,
  title  = {Socially and Contextually Aware Human Motion and Pose Forecasting},
  author = {Vida Adeli and Ehsan Adeli and Ian Reid and Juan Carlos Niebles and Hamid Rezatofighi},
  journal= {arXiv preprint arXiv:2007.06843},
  year   = {2020}
}

备注

Accepted in RA-L and IROS