中文

用于姿态预测的多图卷积网络

计算机视觉与模式识别 2023-04-12 v1

摘要

近年来,预测人体运动——即基于观测到的姿态序列预测未来身体姿态——的兴趣日益增长。该任务因需建模空间与时间关系而十分复杂。最常用的此类模型为自回归模型,如循环神经网络(RNN)或其变体,以及 Transformer 网络。然而,RNN 存在若干缺陷,如梯度消失或爆炸。其他研究者尝试通过集成图卷积网络(GCN)与长短期记忆(LSTM)模型来解决空间维度上的通信问题。这些工作分别处理时间与空间信息,限制了有效性。为解决此问题,我们提出一种称为多图卷积网络(MGCN)的新方法用于 3D 人体姿态预测。该模型通过为姿态序列引入增广图,同时捕获空间与时间信息。多帧给出多个部分,在单一图实例中连接在一起。此外,我们还探究了自然结构与序列感知注意力对模型的影响。在大规模基准数据集 Human3.6M、AMSS 和 3DPW 上的实验评估中,MGCN 在姿态预测上优于最先进方法。

关键词

引用

@article{arxiv.2304.04956,
  title  = {Multi-Graph Convolution Network for Pose Forecasting},
  author = {Hongwei Ren and Yuhong Shi and Kewei Liang},
  journal= {arXiv preprint arXiv:2304.04956},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2110.04573 by other authors