中文

Poseur:基于Transformer的直接人体姿态回归方法

计算机视觉与模式识别 2022-07-21 v2

摘要

我们提出了一种从单幅图像进行2D人体姿态估计的直接、基于回归的方法。我们将该问题表述为序列预测任务,并使用Transformer网络求解。该网络直接学习从图像到关键点坐标的回归映射,而不借助热图等中间表示。该方法避免了基于热图方法所涉及的诸多复杂性。为克服先前基于回归方法的特徵错位问题,我们提出了一种注意力机制,自适应地关注与目标关键点最相关的特徵,显著提高了精度。重要的是,我们的框架是端到端可微分的,并自然地学习利用关键点之间的依赖关系。在MS-COCO和MPII这两个主流姿态估计数据集上的实验表明,我们的方法显著优于基于回归的姿态估计现有最佳方法。更值得注意的是,我们的方法是首个与最佳基于热图的姿态估计方法相比表现更优的基于回归的方法。

关键词

引用

@article{arxiv.2201.07412,
  title  = {Poseur: Direct Human Pose Regression with Transformers},
  author = {Weian Mao and Yongtao Ge and Chunhua Shen and Zhi Tian and Xinlong Wang and Zhibin Wang and Anton van den Hengel},
  journal= {arXiv preprint arXiv:2201.07412},
  year   = {2022}
}

备注

Accepted to Proc. Eur. Conf. Comp. Vision (ECCV) 2022