中文

PriorFormer:一种基于多种几何先验的实时单目 3D 人体姿态估计 Transformer

计算机视觉与模式识别 2025-08-26 v1

摘要

本文提出了一种新的轻量级基于 Transformer 的升空器,将人类 2D 关节位置的短序列映射到 3D 姿态。该模型以几何先验(包括关节段长度和相机内参)为输入,旨在在校准和非校准环境中运行。为此,引入掩码机制,使模型在训练和推理时能够忽略缺失的先验信息。这导致构建一个单一且通用的网络,可适应不同的部署场景,从完全校准的实验室环境到无需校准的野外单目视频。该模型使用来自 AMASS 数据集的 3D 关键点训练,对应的 2D 合成数据通过随机采样相机姿态和内参生成。随后与仅在完整先验下训练的专家模型进行比较,通过消融研究进行验证。结果表明,相机和关节段长度先验均能提升性能,且该通用模型在专家模型之上,即便所有先验都可用时也能保持高准确率,当先验缺失时亦能保持高精度。总体而言,平均 3D 关节中心位置估计精度最高可达 36mm,提升了约半厘米的状态,同时计算成本更低。事实上,本模型在 GPU 上运行仅需 380μ\mus,在 CPU 上仅需 1800μ\mus,适用于嵌入式平台和低功耗设备的部署。

关键词

引用

@article{arxiv.2508.18238,
  title  = {PriorFormer: A Transformer for Real-time Monocular 3D Human Pose Estimation with Versatile Geometric Priors},
  author = {Mohamed Adjel and Vincent Bonnet},
  journal= {arXiv preprint arXiv:2508.18238},
  year   = {2025}
}

备注

2025 IEEE-RAS 24th International Conference on Humanoid Robots, Sep 2025, Seoul (Korea), South Korea