中文

优化局部-全局依赖以实现准确的3D人体姿态估计

计算机视觉与模式识别 2024-12-30 v1

摘要

基于Transformer的方法最近在3D人体姿态估计中取得了显著的成功,主要归功于其强大的长程依赖建模能力。然而,仅依赖全局注意力机制不足以捕获对精细局部细节的建模,这些细节对准确的姿态估计至关重要。为此,我们提出了SSR-STF,一种双流模型,有效地将局部特征与全局依赖性集成以增强3D人体姿态估计。具体而言,我们引入SSRFormer,一个简单而有效的模块,采用骨架选择性细化注意力(SSRA)机制来捕获人体姿态序列中细粒度的局部依赖,补充由Transformer建模的全局依赖。通过自适应融合这两个特征流,SSR-STF能够更好地学习人体姿态的底层结构,克服了传统方法在局部特征提取方面的局限性。在Human3.6M和MPI-INF-3DHP数据集上的大量实验表明,SSR-STF实现了最先进的性能,分别达到P1误差为37.4 mm和13.2 mm,在准确性和泛化性方面均优于现有方法。此外,我们模型学习到的运动表示在人体网格恢复等下游任务中也表现出色。代码已公开于 https://github.com/poker-xu/SSR-STF。

关键词

引用

@article{arxiv.2412.19676,
  title  = {Optimizing Local-Global Dependencies for Accurate 3D Human Pose Estimation},
  author = {Guangsheng Xu and Guoyi Zhang and Lejia Ye and Shuwei Gan and Xiaohu Zhang and Xia Yang},
  journal= {arXiv preprint arXiv:2412.19676},
  year   = {2024}
}