中文

用于 3D 人体形状与姿态估计的多级注意力编解码器

计算机视觉与模式识别 2021-09-07 v1

摘要

3D 人体形状与姿态估计是人体运动分析的基础任务,广泛应用于众多 3D 应用中。然而,现有方法无法同时捕获包括时空级与人体关节级在内的多级关系,因此在存在杂乱背景、遮挡或极端姿态等困难场景下难以做出准确预测。为此,我们提出多级注意力编解码网络(MAED),包含时空编码器(STE)和运动学拓扑解码器(KTD),以在统一框架中建模多级注意力。STE 由一系列基于多头自注意力的级联块组成,每个块使用两个并行分支分别学习空间与时间注意力。同时,KTD 旨在建模关节级注意力,其将姿态估计视为类似于 SMPL 运动学树的自顶向下分层过程。在 3DPW 训练集上,MAED 在三个广泛使用的基准 3DPW、MPI-INF-3DHP 和 Human3.6M 上分别以 PA-MPJPE 指标比先前 SOTA 方法优 6.2、7.2 和 2.4 mm。我们的代码见 https://github.com/ziniuwan/maed。

关键词

引用

@article{arxiv.2109.02303,
  title  = {Encoder-decoder with Multi-level Attention for 3D Human Shape and Pose Estimation},
  author = {Ziniu Wan and Zhengjia Li and Maoqing Tian and Jianbo Liu and Shuai Yi and Hongsheng Li},
  journal= {arXiv preprint arXiv:2109.02303},
  year   = {2021}
}