中文

BTranspose:基于自监督预训练的瓶颈Transformer用于人体姿态估计

机器学习 2022-04-22 v1 计算机视觉与模式识别

摘要

2D人体姿态估计任务具有挑战性,因为关键点数量通常较大(约17个),这需要使用能够从输入图像中捕获相关特征的鲁棒神经网络架构和训练流程。随后聚合这些特征以做出准确的热图预测,从而推断出人体部位的最终关键点。文献中的许多论文使用基于CNN的架构作为骨干网络,和/或将其与Transformer结合,之后聚合特征以做出最终的关键点预测[1]。在本文中,我们考虑了最近提出的瓶颈Transformer(Bottleneck Transformers)[2],其有效地结合了CNN和多头自注意力(MHSA)层,并将其与Transformer编码器集成,应用于2D人体姿态估计任务。我们考虑不同的骨干架构,并使用DINO自监督学习方法[3]对它们进行预训练,发现该预训练可提高整体预测精度。我们将我们的模型称为BTranspose,实验表明在COCO验证集上,我们的模型达到了76.4的AP,与[1]等其他方法具有竞争力,且网络参数更少。此外,我们还展示了最终预测关键点对MHSA块和Transformer编码器层的依赖关系,为网络在中高层关注的图像子区域提供了线索。

关键词

引用

@article{arxiv.2204.10209,
  title  = {BTranspose: Bottleneck Transformers for Human Pose Estimation with Self-Supervised Pre-Training},
  author = {Kaushik Balakrishnan and Devesh Upadhyay},
  journal= {arXiv preprint arXiv:2204.10209},
  year   = {2022}
}

备注

24 pages, 10 figures