通过图像提升——利用图像线索进行精确的3D人体姿态估计
计算机视觉与模式识别
2023-12-27 v1
摘要
由于2D姿态估计器强大的视觉分析能力,“从2D姿态提升”方法一直是3D人体姿态估计(3DHPE)的主流方法。众所周知,仅从2D姿态估计存在深度模糊问题,即一个2D姿态可以映射到多个3D姿态。直观上,图像中丰富的语义和纹理信息有助于更精确的“提升”过程。然而,现有研究面临两个主要挑战。首先,由于实验室环境,3D运动捕捉数据集中的图像数据分布过于狭窄,导致使用图像信息训练的方法泛化能力差。其次,缺乏有效利用图像信息的策略。在本文中,我们对泛化能力差的原因和图像特征的有效性提出了新的见解。基于此,我们提出了一个先进的框架。具体来说,该框架由两个阶段组成。首先,我们使关键点能够从所有图像块中查询和选择有益特征。为了减少关键点对无关背景特征的关注,我们设计了一种新颖的Pose-guided Transformer Layer,它自适应地限制对不重要图像块的更新。然后,通过设计的自适应特征选择模块,我们从特征图中剪枝掉不太重要的图像块。在第二阶段,我们允许关键点进一步强调保留的关键图像特征。这种渐进式学习方法防止了对不重要图像特征的进一步训练。实验结果表明,我们的模型在Human3.6M数据集和MPI-INF-3DHP数据集上都达到了最先进的性能。
引用
@article{arxiv.2312.15636,
title = {Lifting by Image -- Leveraging Image Cues for Accurate 3D Human Pose Estimation},
author = {Feng Zhou and Jianqin Yin and Peiyang Li},
journal= {arXiv preprint arXiv:2312.15636},
year = {2023}
}
备注
Accepted by AAAI24