ViTPose++:用于通用人体姿态估计的视觉 Transformer
计算机视觉与模式识别
2023-12-15 v3
摘要
在本文中,我们通过一个名为 ViTPose 的简单基线模型,从多个方面展示了普通视觉 Transformer 用于人体姿态估计的惊人良好特性,即模型结构简洁、模型规模可扩展、训练范式灵活,以及模型间知识可迁移性。具体而言,ViTPose 采用普通非分层视觉 Transformer 作为编码器提取特征,并采用轻量解码器以自顶向下或自底向上的方式解码人体关键点。它可利用视觉 Transformer 的可扩展模型容量和高并行性,将参数规模从约 20M 扩展到 1B,为吞吐量与性能树立了新的帕累托前沿。此外,ViTPose 在注意力类型、输入分辨率以及预训练与微调策略方面非常灵活。基于该灵活性,提出了一种新颖的 ViTPose+ 模型,通过知识分解(即在 Transformer 中采用任务无关与任务特定的前馈网络)来处理不同类型人体姿态估计任务中的异质人体关键点类别。我们还通过经验证明,大型 ViTPose 模型的知识可借助简单的知识令牌轻松迁移到小型模型。实验结果表明,我们的 ViTPose 模型在具有挑战性的 MS COCO 人体关键点检测基准上,于自顶向下与自底向上设置中均优于代表性方法。此外,我们的 ViTPose+ 模型在人体关键点检测的 MS COCO、AI Challenger、OCHuman、MPII,全身关键点检测的 COCO-Wholebody,以及动物关键点检测的 AP-10K 和 APT-36K 等一系列人体姿态估计任务上同时取得了最先进的性能,且不牺牲推理速度。
引用
@article{arxiv.2212.04246,
title = {ViTPose++: Vision Transformer for Generic Body Pose Estimation},
author = {Yufei Xu and Jing Zhang and Qiming Zhang and Dacheng Tao},
journal= {arXiv preprint arXiv:2212.04246},
year = {2023}
}
备注
Extension of ViTPose paper, accepted by TPAMI