中文

PoseCraft: 基于分词化 3D 身体 landmark 和相机条件的光影人类图像合成

计算机视觉与模式识别 2026-02-24 v1

摘要

为虚拟现实、远程存在和娱乐仿真人类并生成具有显式 3D 姿态和相机控制的逼真人像是核心任务。现有的基于皮肤的工作流程需要繁琐的手动 rigging 或模板式贴合,而神经体积方法则依赖标准模板并为每个不可见姿态进行重新优化。在本工作中,我们提出 PoseCraft,一个围绕分词化 3D 接口构建的扩散框架:我们不依赖仅使用 2D 控制图像的 rasterized 几何,而是将稀疏 3D landmark 和相机外参编码为离散条件 token 并通过跨注意力机制注入扩散模型。我们的做法通过避免在大姿态和视点变化下的 2D 重投影歧义,保持了 3D 语义,并产生捕捉身份和外观的逼真图像。为大规模训练与评估,我们还实现了 GenHumanRF,一个从体积重建渲染多样化监督的数据生成工作流程。我们的实验表明,PoseCraft 在感知质量上显著优于以扩散为中心的方法,并在保持面料和头发细节方面,达到或优于最新的体积渲染 SOTA 的性能。

关键词

引用

@article{arxiv.2602.19350,
  title  = {PoseCraft: Tokenized 3D Body Landmark and Camera Conditioning for Photorealistic Human Image Synthesis},
  author = {Zhilin Guo and Jing Yang and Kyle Fogarty and Jingyi Wan and Boqiao Zhang and Tianhao Wu and Weihao Xia and Chenliang Zhou and Sakar Khattar and Fangcheng Zhong and Cristina Nader Vasconcelos and Cengiz Oztireli},
  journal= {arXiv preprint arXiv:2602.19350},
  year   = {2026}
}