PPT:用于单目与多视角人体姿态估计的令牌剪枝姿态Transformer
计算机视觉与模式识别
2022-09-20 v1
摘要
近来,视觉transformer及其变体在单目与多视角人体姿态估计中发挥着越来越重要的作用。将图像块视为令牌,transformers可建模整幅图像内或来自其他视角的图像间的全局依赖关系。然而,全局注意力计算代价高昂。因此,难以将这些基于transformer的方法扩展到高分辨率特征与多视角。本文提出用于2D人体姿态估计的令牌剪枝姿态Transformer (PPT),其可定位粗略人体掩码并仅在所选令牌内执行自注意力。此外,我们将PPT扩展到多视角人体姿态估计。基于PPT,我们提出一种称为人体区域融合的新跨视角融合策略,将所有人体前景像素视为对应候选。在COCO和MPII上的实验结果表明,我们的PPT能在降低计算量的同时匹配先前姿态transformer方法的精度。而且,在Human 3.6M和Ski-Pose上的实验表明,我们的多视角PPT能高效融合多视角线索并达到新的最先进结果。
引用
@article{arxiv.2209.08194,
title = {PPT: token-Pruned Pose Transformer for monocular and multi-view human pose estimation},
author = {Haoyu Ma and Zhe Wang and Yifei Chen and Deying Kong and Liangjian Chen and Xingwei Liu and Xiangyi Yan and Hao Tang and Xiaohui Xie},
journal= {arXiv preprint arXiv:2209.08194},
year = {2022}
}
备注
ECCV 2022. Code is available at https://github.com/HowieMa/PPT