中文

DiffPortrait3D:用于零样本人像视图合成的可控扩散模型

计算机视觉与模式识别 2025-03-21 v4

摘要

我们提出了DiffPortrait3D,一种条件扩散模型,能够仅从一张自然场景人像合成3D一致且逼真的新视图。具体而言,给定单个RGB输入,我们的目标是合成从新相机视角渲染的合理且一致的面部细节,同时保持身份和面部表情。无需耗时的优化和微调,我们的零样本方法能很好地泛化到具有非受控相机视角、极端面部表情和多样化艺术描绘的任意人脸肖像。在其核心,我们利用在大规模图像数据集上预训练的2D扩散模型的生成先验作为渲染骨干,同时通过外观与相机姿态的解耦注意力控制来引导去噪过程。为此,我们首先将参考图像中的外观上下文注入冻结UNet的自注意力层。然后,通过一个新颖的条件控制模块来操控渲染视角,该模块通过观察同一视角下交叉主体的条件图像来解释相机姿态。此外,我们插入了一个可训练的跨视图注意力模块以增强视图一致性,并在推理过程中通过一种新颖的3D感知噪声生成过程进一步强化这种一致性。我们在极具挑战性的自然场景和多视图基准上展示了定性和定量的最先进结果。

关键词

引用

@article{arxiv.2312.13016,
  title  = {DiffPortrait3D: Controllable Diffusion for Zero-Shot Portrait View Synthesis},
  author = {Yuming Gu and You Xie and Hongyi Xu and Guoxian Song and Yichun Shi and Di Chang and Jing Yang and Linjie Luo},
  journal= {arXiv preprint arXiv:2312.13016},
  year   = {2025}
}