Text2Control3D:基于几何引导文本到图像扩散模型在神经辐射场中的可控 3D 化身生成
计算机视觉与模式识别
2023-09-08 v1
摘要
ControlNet 等扩散模型的最新进展已实现几何可控、高保真的文本到图像生成。然而,它们均未解决将此类可控性引入文本到 3D 生成的问题。为此,我们提出 Text2Control3D,一种可控的文本到 3D 化身生成方法,其面部表情可由手持相机随意拍摄的单目视频控制。我们的主要策略是在神经辐射场 (NeRF) 中构建 3D 化身,并使用一组受控的视角感知图像进行优化;这些图像由 ControlNet 生成,其条件输入为从输入视频提取的深度图。在生成视角感知图像时,我们利用交叉参考注意力,通过交叉注意力注入受控良好的、参考性的面部表情与外观。我们还对扩散模型的高斯潜变量进行低通滤波,以改善从实证分析中观察到的视角无关纹理问题,即视角感知图像在相同的像素位置上包含相同的、在 3D 中无法理解的纹理。最后,为用视角感知但在几何上并非严格一致的图像训练 NeRF,我们的方法将每图像几何变化视为从共享 3D 规范空间的形变视图。因此,我们通过形变场表学习一组每图像形变,在可形变 NeRF 的规范空间中构建 3D 化身。我们展示了实证结果并讨论了方法的有效性。
引用
@article{arxiv.2309.03550,
title = {Text2Control3D: Controllable 3D Avatar Generation in Neural Radiance Fields using Geometry-Guided Text-to-Image Diffusion Model},
author = {Sungwon Hwang and Junha Hyung and Jaegul Choo},
journal= {arXiv preprint arXiv:2309.03550},
year = {2023}
}
备注
Project page: https://text2control3d.github.io/