中文

面对面交互场景中人体运动与姿态预测时空模型的比较

计算机视觉与模式识别 2022-03-08 v1 机器人学

摘要

人际交互中的人类行为预测对于赋予机器或虚拟智能体社会智能至关重要。该问题在高度由人际动态驱动的场景中尤为具有挑战性。本文中,我们首次对最先进的行为预测方法进行了系统比较。为此,我们利用最新发布的 UDIVA v0.5 中的全身标注(面部、身体和手),该数据集包含面对面双人交互。我们最佳的基于注意力的方法在 UDIVA v0.5 上取得了最先进的性能。我们表明,通过自回归地预测未来,使用为短期未来(<400ms)训练的方法,即使在相当长期的未来(长达 2s)我们也优于基线。我们还表明,当使用高度噪声的标注时这一发现依然成立,这为弱监督学习的应用开辟了新前景。结合大规模数据集,这可能有助于推动该领域的进展。

关键词

引用

@article{arxiv.2203.03245,
  title  = {Comparison of Spatio-Temporal Models for Human Motion and Pose Forecasting in Face-to-Face Interaction Scenarios},
  author = {German Barquero and Johnny Núñez and Zhen Xu and Sergio Escalera and Wei-Wei Tu and Isabelle Guyon and Cristina Palmero},
  journal= {arXiv preprint arXiv:2203.03245},
  year   = {2022}
}

备注

single column, 27 pages, 7 figures, 7 tables