AiOS:面向多人表达人体姿态与形状的全一阶段框架
计算机视觉与模式识别
2024-03-27 v1
摘要
表达的人体姿态与形状估计(即 3D 全身网格恢复)涉及人体、手部和表情的估计。大多数现有方法以两阶段方式解决该任务,首先使用离线检测模型检测人体部位,然后分别推断不同的人体部位。尽管取得了令人印象的成绩,但这些方法存在 1) 通过裁剪丢失有价值上下文信息、2) 引入干扰因素以及 3) 缺乏不同人员和身体部件之间的关联,必然导致性能下降,尤其是在拥挤场景中。为解决这些问题,我们提出了一种新的全一阶段框架 AiOS,用于无需额外人体检测步骤的多人表达人体姿态与形状恢复。具体而言,我们的方法基于 DETR,将多人全身网格恢复任务作为逐步的集合预测问题,并结合各种顺序检测。我们设计了解码器标记并将其扩展到我们的任务。具体来说,我们首先使用人体标记在图像中探测人体位置并编码每个实例的全局特征,这为后续变换器块提供粗略位置。然后,我们引入与人体关节相关的标记在图像中探测人体关节并编码精细的局部特征,这与全局特征协同回归全身网格。这一简单而有效的模型在 AGORA 上将 NMVE 降低 9%,在 EHF 上将 PVE 降低 30%,在 ARCTIC 上将 PVE 降低 10%,在 EgoBody 上将 PVE 降低 3%。
引用
@article{arxiv.2403.17934,
title = {AiOS: All-in-One-Stage Expressive Human Pose and Shape Estimation},
author = {Qingping Sun and Yanjun Wang and Ailing Zeng and Wanqi Yin and Chen Wei and Wenjia Wang and Haiyi Mei and Chi Sing Leung and Ziwei Liu and Lei Yang and Zhongang Cai},
journal= {arXiv preprint arXiv:2403.17934},
year = {2024}
}
备注
Homepage: https://ttxskk.github.io/AiOS/