中文

Text2Control3D:基于几何引导文本到图像扩散模型在神经辐射场中的可控 3D 化身生成

计算机视觉与模式识别 2023-09-08 v1

摘要

ControlNet 等扩散模型的最新进展已实现几何可控、高保真的文本到图像生成。然而,它们均未解决将此类可控性引入文本到 3D 生成的问题。为此,我们提出 Text2Control3D,一种可控的文本到 3D 化身生成方法,其面部表情可由手持相机随意拍摄的单目视频控制。我们的主要策略是在神经辐射场 (NeRF) 中构建 3D 化身,并使用一组受控的视角感知图像进行优化;这些图像由 ControlNet 生成,其条件输入为从输入视频提取的深度图。在生成视角感知图像时,我们利用交叉参考注意力,通过交叉注意力注入受控良好的、参考性的面部表情与外观。我们还对扩散模型的高斯潜变量进行低通滤波,以改善从实证分析中观察到的视角无关纹理问题,即视角感知图像在相同的像素位置上包含相同的、在 3D 中无法理解的纹理。最后,为用视角感知但在几何上并非严格一致的图像训练 NeRF,我们的方法将每图像几何变化视为从共享 3D 规范空间的形变视图。因此,我们通过形变场表学习一组每图像形变,在可形变 NeRF 的规范空间中构建 3D 化身。我们展示了实证结果并讨论了方法的有效性。

关键词

引用

@article{arxiv.2309.03550,
  title  = {Text2Control3D: Controllable 3D Avatar Generation in Neural Radiance Fields using Geometry-Guided Text-to-Image Diffusion Model},
  author = {Sungwon Hwang and Junha Hyung and Jaegul Choo},
  journal= {arXiv preprint arXiv:2309.03550},
  year   = {2023}
}

备注

Project page: https://text2control3d.github.io/