中文

L3D-Pose:从单摄像机中野生环境下的3D化身姿态提升

计算机视觉与模式识别 2025-01-03 v1 人工智能

摘要

虽然2D姿态估计已使我们能够解读动物与灵长类的身体动作,但由于缺乏深度信息,限制了其应用范围。3D姿态估计通过融合空间深度信息提供更为全面的解决方案,但为动物创建大量3D姿态数据集具有挑战性,因为动物在自然环境中的行为具有动态性和不可预测性。为此,我们提出一种混合方法,利用装配好的化身及其管线生成合成数据集,以获取训练所需的3D标注。我们引入一种基于注意力的多层感知器网络,用于将2D姿态转换为3D,旨在独立于输入图像,以确保在自然环境中的姿态可扩展性。此外,我们发现现有的解剖关键点检测器不足以对任意化身进行精确的姿态映射。为此,我们提出一种基于查找表的深度姿态估计方法,利用合成的多样化动作装配化身集合。我们的实验表明,这种基于查找表的重定向方法在有效性与效率方面均表现出色。总体而言,我们提出了一个系统化的综合框架,包含合成数据集,用于将2D姿态提升至3D,并将其用于将野生环境中的动作重定向至任意化身。

关键词

引用

@article{arxiv.2501.01174,
  title  = {L3D-Pose: Lifting Pose for 3D Avatars from a Single Camera in the Wild},
  author = {Soumyaratna Debnath and Harish Katti and Shashikant Verma and Shanmuganathan Raman},
  journal= {arXiv preprint arXiv:2501.01174},
  year   = {2025}
}

备注

2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)