中文

用于图像与视频中三维人体姿态估计的双链约束

计算机视觉与模式识别 2023-08-11 v1 人工智能

摘要

从缺乏深度信息的二维姿态重建三维姿态由于人体运动的复杂性与多样性而极具挑战。关键在于有效建模关节间的空间约束以利用其内在依赖关系。为此,我们提出一种称为双链图卷积 Transformer(DC-GCT)的新模型,通过由局部到全局与全局到局部链组成的双链设计来约束姿态,从而获得更适于当前人体姿态的复杂表示。具体而言,我们结合 GCN 与 Transformer 的优势,设计了基于 GCN 的局部约束模块(LCM)、基于自注意力机制的全局约束模块(GCM)以及特征交互模块(FIM)。所提方法充分捕获人体关节间的多级依赖以优化模型的建模能力。此外,我们提出一种以可忽略的计算代价增加将时序信息引入单帧模型的方法:通过目标帧的关节嵌入引导视频序列嵌入。实验结果表明,DC-GCT 在两个具挑战性的数据集(Human3.6M 与 MPI-INF-3DHP)上取得了最先进的性能。值得注意的是,我们的模型在使用来自 CPN 的检测二维姿态时,于 Human3.6M 数据集的所有动作类别上均达到最先进性能,且我们的代码见于:https://github.com/KHB1698/DC-GCT。

关键词

引用

@article{arxiv.2308.05298,
  title  = {Double-chain Constraints for 3D Human Pose Estimation in Images and Videos},
  author = {Hongbo Kang and Yong Wang and Mengyuan Liu and Doudou Wu and Peng Liu and Wenming Yang},
  journal= {arXiv preprint arXiv:2308.05298},
  year   = {2023}
}