PE-former:姿态估计Transformer
计算机视觉与模式识别
2021-12-10 v1 机器学习
摘要
视觉Transformer架构已被证明在图像分类任务中非常有效。利用Transformer解决更具挑战性的视觉任务的努力依赖于卷积骨干网络进行特征提取。在本文中,我们研究将纯Transformer架构(即无CNN骨干网络)用于2D人体姿态估计问题。我们在COCO数据集上评估了两种ViT架构。我们证明,使用编码器-解码器Transformer架构在该估计问题上取得了最先进的结果。
引用
@article{arxiv.2112.04981,
title = {PE-former: Pose Estimation Transformer},
author = {Paschalis Panteleris and Antonis Argyros},
journal= {arXiv preprint arXiv:2112.04981},
year = {2021}
}