基于GraAttention的K阶图导向Transformer用于三维姿态与形状估计
计算机视觉与模式识别
2022-09-27 v2
摘要
我们提出了一种用于图结构数据的基于注意力的二维到三维姿态估计网络,名为KOG-Transformer,以及一种用于手部数据的三维姿态到形状估计网络,名为GASE-Net。以往的三维姿态估计方法侧重于对图卷积核的各种修改,例如放弃权值共享或增大感受野。其中一些方法采用基于注意力的非局部模块作为辅助模块。为了更好地建模图结构数据中节点之间的关系并以差异化方式融合不同邻居节点的信息,我们对注意力模块进行了针对性修改,提出了两个为图结构数据设计的模块:图相对位置编码多头自注意力(GR-MSA)和K阶图导向多头自注意力(KOG-MSA)。通过堆叠GR-MSA和KOG-MSA,我们提出了一种用于二维到三维姿态估计的新网络KOG-Transformer。此外,我们提出了一种用于手部数据形状估计的网络,称为GraAttention形状估计网络(GASE-Net),它以三维姿态为输入,从稀疏到稠密逐步建模手的形状。我们通过大量实验实证展示了KOG-Transformer的优越性。实验结果表明,KOG-Transformer在基准数据集Human3.6M上显著优于先前的最先进方法。我们在两个公开可用的手部数据集ObMan和InterHand2.6M上评估了GASE-Net的效果。GASE-Net能够预测输入姿态对应的形状,并具有强大的泛化能力。
引用
@article{arxiv.2208.11328,
title = {K-Order Graph-oriented Transformer with GraAttention for 3D Pose and Shape Estimation},
author = {Weixi Zhao and Weiqiang Wang},
journal= {arXiv preprint arXiv:2208.11328},
year = {2022}
}