中文

分阶段接触感知的全局人体运动预测

计算机视觉与模式识别 2023-09-19 v1

摘要

场景感知的全局人体运动预测对虚拟现实、机器人与体育等众多应用至关重要。该任务结合给定场景上下文下的人体轨迹与姿态预测,是一项重大挑战。迄今,仅有 Mao 等人 NeurIPS'22 解决了场景感知全局运动,级联预测未来场景接触点与全局运动估计。他们将后者作为未来轨迹与姿态的端到端预测。然而,端到端与任务的由粗到细本质相悖,且如我们本文经验所示会导致更低的性能。我们提出 STAGed 接触感知全局人体运动预测 STAG,一种用于预测三维环境中全局人体运动的新型三阶段流水线。我们首先将场景及相应人体交互视为接触点。其次,我们建模场景内人体轨迹预测,预测人体整体的粗略运动。第三也是最后阶段匹配合理的精细人体关节运动,结合估计的接触点以补全轨迹。相较于最先进(SoA)方法,STAG 在场景感知 GTA-IM 数据集上姿态与轨迹预测分别取得 1.8% 和 16.2% 的总体提升。全面的消融研究证实了分阶段建模优于端到端方法。此外,我们确立了新提出的称为“剩余时间(time-to-go)”的时序计数器的重要性,其指示到达场景接触点与终点前的剩余时长。值得注意的是,STAG 展示了其泛化到缺乏场景的数据集的能力,并在不使用任何社交线索的情况下于 CMU-Mocap 上取得新的最先进性能。我们的代码发布于:https://github.com/L-Scofano/STAG

关键词

引用

@article{arxiv.2309.08947,
  title  = {Staged Contact-Aware Global Human Motion Forecasting},
  author = {Luca Scofano and Alessio Sampieri and Elisabeth Schiele and Edoardo De Matteis and Laura Leal-Taixé and Fabio Galasso},
  journal= {arXiv preprint arXiv:2309.08947},
  year   = {2023}
}

备注

15 pages, 7 figures, BMVC23 oral