中文

SMPLer-X:扩展表达性人体姿态与形状估计

计算机视觉与模式识别 2024-07-30 v3

摘要

表达性人体姿态与形状估计(EHPS)统一了身体、手部与面部的动作捕捉,具有众多应用。尽管取得了令人鼓舞的进展,当前最先进的方法仍很大程度上依赖于受限的训练数据集集合。在本工作中,我们研究将 EHPS 扩展至首个通用基础模型(称为 SMPLer-X),其以最大 ViT-Huge 为骨干,并使用来自多样数据源的多达 4.5M 实例进行训练。借助大数据与大模型,SMPLer-X 在多样化测试基准上展现出强劲性能,并对甚至未见过的环境具有优异的可迁移性。1)对于数据扩展,我们对 32 个 EHPS 数据集进行了系统性调研,涵盖了在任一单一数据集上训练的模型均无法处理的广泛场景。更重要的是,利用从广泛基准测试过程中获得的洞见,我们优化了训练方案并筛选数据集,从而带来 EHPS 能力的显著跃升。2)对于模型扩展,我们利用视觉 transformers 研究了 EHPS 中模型尺寸的缩放定律。此外,我们的微调策略将 SMPLer-X 转化为专用模型,使其获得进一步的性能提升。值得注意的是,我们的基础模型 SMPLer-X 在 AGORA(107.2 mm NMVE)、UBody(57.4 mm PVE)、EgoBody(63.6 mm PVE)与 EHF(62.3 mm PVE,无微调)等七个基准上持续给出最先进结果。主页:https://caizhongang.github.io/projects/SMPLer-X/

关键词

引用

@article{arxiv.2309.17448,
  title  = {SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimation},
  author = {Zhongang Cai and Wanqi Yin and Ailing Zeng and Chen Wei and Qingping Sun and Yanjun Wang and Hui En Pang and Haiyi Mei and Mingyuan Zhang and Lei Zhang and Chen Change Loy and Lei Yang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2309.17448},
  year   = {2024}
}

备注

Homepage: https://caizhongang.github.io/projects/SMPLer-X/