用于 3D 人体姿态估计的多跳图变换网络
计算机视觉与模式识别
2024-05-07 v1
摘要
3D 人体姿态估计因遮挡和深度歧义而具有挑战性。本文提出一种多跳图变换网络,用于视频中的 2D 到 3D 人体姿态估计,充分利用多头自注意力和多跳图卷积网络(其中包含解缠解耦的邻域)来捕获时空依赖性并处理长程相互作用。该提议网络架构包括由堆叠的多头自注意力和图卷积层组成的图注意力块,以及由多跳卷积和稀疏卷积层组成的多跳图卷积块。多头自注意力和多跳图卷积层的结合使模型能够捕获局部和全局依赖关系,而稀疏卷积层的集成则增强了模型处理 accurately 定位人体关节所必需的空间细节的能力。广泛的实验结果表明,我们的方法在基准数据集上实现了竞争的性能,显示出良好的有效性和泛化能力。
引用
@article{arxiv.2405.03055,
title = {Multi-hop graph transformer network for 3D human pose estimation},
author = {Zaedul Islam and A. Ben Hamza},
journal= {arXiv preprint arXiv:2405.03055},
year = {2024}
}