中文

针对单视图人体的 3D 重建:基于姿态的直接奖励微调

计算机视觉与模式识别 2026-03-04 v1

摘要

单视图 3D 人体重建通过采用多视图扩散模型已取得显著进展,但恢复的 3D 人体常呈现不自然的姿态。当重建具有动态或具挑战性姿态的 3D 人体时,这一现象尤为突出,我们将其归因于可获得 3D 人体数据集规模有限,尤其是姿态多样性。为解决这一局限,我们引入了 DrPose,即 Pose 的直接奖励微调算法,使多视图扩散模型能够在不需昂贵 3D 人体资源的情况下对 diverse poses 进行后训练。DrPose 只使用人体姿态与单视图图像配对的数据训练模型,采用直接奖励微调以最大化我们提出的 PoseScore,即一种量化生成的多视图潜在图像与真实人体姿态一致性的可微分奖励。该优化在 DrPose15K 上进行,我们构建了一个来自现有人体动作数据集和姿态条件视频生成模型的新数据集。DrPose15K 由丰富的人体姿态序列数据构成,姿态分布广泛于现有 3D 人体数据集之外。我们在常规基准数据集、野外图像以及新构建的基准上进行评估,特别关注在具挑战性人体姿态上的性能。我们的结果在所有基准测试中均实现了持续的定性和定量改进。项目页面:https://seunguk-do.github.io/drpose。

关键词

引用

@article{arxiv.2603.02619,
  title  = {Direct Reward Fine-Tuning on Poses for Single Image to 3D Human in the Wild},
  author = {Seunguk Do and Minwoo Huh and Joonghyuk Shin and Jaesik Park},
  journal= {arXiv preprint arXiv:2603.02619},
  year   = {2026}
}

备注

ICLR 2026, Project webpage: https://seunguk-do.github.io/drpose