中文

基于网格卷积的3D人体姿态提升

计算机视觉与模式识别 2023-02-20 v1 人工智能 机器学习

摘要

现有用于从2D单视角姿态回归3D人体姿态的提升网络通常基于图结构表示学习以线性层构建。与之形成鲜明对比,本文提出网格卷积(GridConv),模仿图像空间中规则卷积操作的智慧。GridConv基于一种新颖的语义网格变换(SGT),其利用二值分配矩阵将不规则图结构人体姿态逐关节映射为规则的编织状网格姿态表示,从而能够通过GridConv操作进行逐层特征学习。我们提供两种实现SGT的方式,包括手工设计与可学习设计。令人惊讶的是,两种设计均取得了有前景的结果,且可学习设计更优,展示了这一新提升表示学习公式的巨大潜力。为提升GridConv编码上下文线索的能力,我们引入了一种卷积核上的注意力模块,使网格卷积操作依赖于输入、具有空间感知且网格特定。我们表明,在(1)Human3.6M上的常规评估和(2)MPI-INF-3DHP上的交叉评估下,我们全卷积网格提升网络以显著优势优于最先进方法。代码见 https://github.com/OSVAI/GridConv

关键词

引用

@article{arxiv.2302.08760,
  title  = {3D Human Pose Lifting with Grid Convolution},
  author = {Yangyuxuan Kang and Yuyang Liu and Anbang Yao and Shandong Wang and Enhua Wu},
  journal= {arXiv preprint arXiv:2302.08760},
  year   = {2023}
}

备注

Oral paper at AAAI 2023. Project website: https://github.com/OSVAI/GridConv