中文

DreamPose3D:结合提示学习与幻觉扩散的 3D 人体姿态估计

计算机视觉与模式识别 2025-11-13 v1 人工智能

摘要

精确的 3D 人体姿态估计仍然是一个关键且未解决的挑战,需要跨帧的时间连贯性和关节关系的细粒度建模。然而,大多数现有方法仅依赖几何线索并独立预测每个 3D 姿态,这限制了它们解决模糊运动和泛化到真实场景的能力。受人类理解和预测运动方式的启发,我们引入了 DreamPose3D,这是一个基于扩散的框架,将动作感知推理与时间想象相结合用于 3D 姿态估计。DreamPose3D 利用从 2D 姿态序列中提取的与任务相关的动作提示,动态调节去噪过程,以捕捉高层意图。为了有效地建模关节之间的结构关系,我们引入了一个表示编码器,将运动学关节亲和力纳入注意力机制中。最后,一个幻觉姿态解码器在训练期间预测时间连贯的 3D 姿态序列,模拟人类如何在心理上重建运动轨迹以解决感知中的模糊性。在基准 Human3.6M 和 MPI-3DHP 数据集上的大量实验表明,该方法在所有指标上均达到了 SOTA 性能。为了进一步验证 DreamPose3D 的鲁棒性,我们在广播棒球数据集上对其进行了测试,尽管 2D 输入存在模糊和噪声,它仍表现出强大的性能,有效处理了时间连贯性和意图驱动的运动变化。

关键词

引用

@article{arxiv.2511.09502,
  title  = {DreamPose3D: Hallucinative Diffusion with Prompt Learning for 3D Human Pose Estimation},
  author = {Jerrin Bright and Yuhao Chen and John S. Zelek},
  journal= {arXiv preprint arXiv:2511.09502},
  year   = {2025}
}