中文

RTMW:实时多人 2D 和 3D 全身姿态估计

计算机视觉与模式识别 2024-07-12 v1

摘要

全身姿态估计是一项具有挑战性的任务,需要同时预测身体、手部、面部和脚部的关键点。全身姿态估计旨在为人体身体部位(包括面部、躯干、手部和脚部)预测细粒度的姿态信息,这在人类中心的感知与生成研究中发挥着重要作用,并在各种应用场景中发挥作用。在本工作中,我们提出了 RTMW(Real-Time Multi-person Wholebody姿态估计模型),这是一系列高性能的 2D/3D 全身姿态估计模型。我们将 RTMPose 模型架构与 FPN 和 HEM(层次编码模块)相结合,以更好地捕获来自不同尺度下身体各部位的姿态信息。该模型在大量带有手动对齐注释的开源人类关键点数据集上进行训练,并通过两阶段蒸馏策略进一步得到增强。RTMW 在多个全身姿态估计基准测试上表现出色,同时保持高的推理效率和部署友好性。我们发布了三个规模:m/l/x,其中 RTMW-l 在 COCO-Wholebody 基准测试上实现了 70.2 的 mAP,成为首个在该基准测试上超过 70 分 mAP 的开源模型。同时,我们探索了 RTMW 在 3D 全身姿态估计任务中的表现,采用坐标分类方式进行基于图像的单目 3D 全身姿态估计。我们希望本工作能为学术研究和工业应用两者带来帮助。代码和模型已在 https://github.com/open-mmlab/mmpose/tree/main/projects/rtmpose 上公开获取。

关键词

引用

@article{arxiv.2407.08634,
  title  = {RTMW: Real-Time Multi-Person 2D and 3D Whole-body Pose Estimation},
  author = {Tao Jiang and Xinchen Xie and Yining Li},
  journal= {arXiv preprint arXiv:2407.08634},
  year   = {2024}
}