中文

SMPLest-X:表达性人体姿态与形状估计的终极缩放

计算机视觉与模式识别 2025-01-20 v1 图形学 人机交互 多媒体 机器人学

摘要

表达性人体姿态与形状估计(EHPS)将身体、手部和面部动作捕捉统一起来,具有众多应用。尽管取得了令人鼓舞的进展,但当前最先进的方法侧重于在受限数据集上训练创新的架构设计。在本工作中,我们研究了将 EHPS 缩放向通用基础模型家族的影响。1)在数据缩放方面,我们对 40 个 EHPS 数据集进行了系统调查,涵盖了任何单一数据集上训练的模型无法处理的广泛场景。更重要的是,利用从广泛基准测试过程中获得的见解,我们优化了训练方案并选择了数据集,使得 EHPS 能力实现了显著飞跃。最终,我们在来自不同数据源的 1000 万训练实例处实现了边际收益递减。2)在模型缩放方面,我们利用 vision transformer(最高以 ViT-Huge 作为骨干网络)来研究 EHPS 中模型大小的缩放律。为了排除算法设计的影响,我们的实验基于两种极简架构:SMPLer-X(包含用于手部和面部定位的中间步骤)和 SMPLest-X(一种更简化的版本,将网络精简至最基本要素,并突出了在捕捉铰接式手部方面的显著进步)。凭借大数据和大模型,基础模型在多样化的测试基准上表现出强大的性能,并且对甚至未见过的环境具有出色的迁移能力。此外,我们的微调策略将通用模型转化为专家模型,使其能够实现进一步的性能提升。值得注意的是,我们的基础模型在 AGORA、UBody、EgoBody 以及我们提出的用于全面手部评估的 SynHand 数据集等七个基准上始终如一地提供最先进的结果。(代码获取地址:https://github.com/wqyin/SMPLest-X)。

关键词

引用

@article{arxiv.2501.09782,
  title  = {SMPLest-X: Ultimate Scaling for Expressive Human Pose and Shape Estimation},
  author = {Wanqi Yin and Zhongang Cai and Ruisi Wang and Ailing Zeng and Chen Wei and Qingping Sun and Haiyi Mei and Yanjun Wang and Hui En Pang and Mingyuan Zhang and Lei Zhang and Chen Change Loy and Atsushi Yamashita and Lei Yang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2501.09782},
  year   = {2025}
}

备注

An extension of SMPLer-X [arXiv:2309.17448]. Homepage: https://caizhongang.com/projects/SMPLer-X/