中文

ViTPose:面向人体姿态估计的简洁视觉Transformer基线

计算机视觉与模式识别 2022-10-14 v3

摘要

尽管在设计时未考虑特定领域知识,普通视觉Transformer已在视觉识别任务中展现出卓越性能。然而,鲜有工作致力于揭示此类简洁结构在姿态估计任务中的潜力。本文通过一个名为ViTPose的简洁基线模型,从模型结构的简洁性、模型规模的可扩展性、训练范式的灵活性以及模型间知识的可迁移性等多个方面,展示了普通视觉Transformer在姿态估计中令人惊讶的强大能力。具体而言,ViTPose采用普通且非层次化的视觉Transformer作为骨干网络,为给定人体实例提取特征,并采用轻量级解码器进行姿态估计。利用Transformer可扩展的模型容量和高并行性优势,其参数量可从1亿扩展至10亿,在吞吐量与性能之间建立了新的帕累托前沿。此外,ViTPose在注意力类型、输入分辨率、预训练与微调策略以及处理多种姿态任务方面均非常灵活。我们还通过实验证明,大型ViTPose模型的知识可通过一个简单的知识令牌轻松迁移至小型模型。实验结果表明,我们的基础ViTPose模型在具有挑战性的MS COCO关键点检测基准上优于代表性方法,而最大模型则达到了新的最优水平。代码与模型已开源,地址为https://github.com/ViTAE-Transformer/ViTPose。

关键词

引用

@article{arxiv.2204.12484,
  title  = {ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation},
  author = {Yufei Xu and Jing Zhang and Qiming Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2204.12484},
  year   = {2022}
}

备注

Neurips 2022. 81.1 mAP on MS COCO Keypoint Detection test-dev set. V2: Update Multi-task training results: 92.8 AP on OCHuman, 78.3 AP on CrowdPose, 94.3 PCKh on MPII, and 43.2 AP on AI Challenger