PoseFormerV2:探索频域以实现高效鲁棒的3D人体姿态估计
计算机视觉与模式识别
2023-03-31 v1
摘要
近来,基于transformer的方法在序列化2D到3D提升人体姿态估计中取得了显著成功。作为开创性工作,PoseFormer利用级联transformer层捕捉每视频帧中人体关节的空间关系及跨帧的人体动态,并实现了令人印象深刻的性能。然而,在实际场景中,PoseFormer及其后续方法的性能受限于两个因素:(a) 输入关节序列的长度;(b) 2D关节检测的质量。现有方法通常对输入序列所有帧施加自注意力,在帧数增加以获取更优估计精度时造成巨大计算负担,且它们对2D关节检测器有限能力自然带来的噪声不具备鲁棒性。本文提出PoseFormerV2,其利用频域中冗长骨架序列的紧凑表示,以高效扩展感受野并提升对含噪2D关节检测的鲁棒性。在对PoseFormer最小改动下,所提方法有效融合时域与频域特征,享有优于其前身的速度-精度权衡。在两个基准数据集(即Human3.6M和MPI-INF-3DHP)上的大量实验表明,该方法显著优于原始PoseFormer及其他基于transformer的变体。代码发布于\url{https://github.com/QitaoZhao/PoseFormerV2}。
引用
@article{arxiv.2303.17472,
title = {PoseFormerV2: Exploring Frequency Domain for Efficient and Robust 3D Human Pose Estimation},
author = {Qitao Zhao and Ce Zheng and Mengyuan Liu and Pichao Wang and Chen Chen},
journal= {arXiv preprint arXiv:2303.17472},
year = {2023}
}
备注
Accepted to CVPR 2023. Project page: https://qitaozhao.github.io/PoseFormerV2