DiLightNet:基于扩散的图像生成中的细粒度光照控制
计算机视觉与模式识别
2024-05-29 v2 图形学
摘要
本文提出了一种新颖的方法,用于在文本驱动的基于扩散的图像生成过程中实施细粒度的光照控制。虽然现有的扩散模型已具备在任何光照条件下生成图像的能力,但在缺乏额外引导的情况下,这些模型倾向于将图像内容与光照相关联。此外,文本提示缺乏描述详细光照设置所需的表达能力。为了使内容创作者能够在图像生成过程中对光照进行细粒度控制,我们以辐射提示(radiance hints)的形式增强文本提示,即在目标光照下具有均匀规范材质的场景几何可视化。然而,生成辐射提示所需的场景几何是未知的。我们的关键观察是,我们只需要引导扩散过程,因此精确的辐射提示并非必要;我们只需将扩散模型指向正确的方向。基于这一观察,我们引入了一种三阶段方法来控制图像生成过程中的光照。在第一阶段,我们利用标准的预训练扩散模型在不受控光照下生成临时图像。接下来,在第二阶段,我们将目标光照传递给一个名为 DiLightNet 的改进扩散模型,利用从临时图像中推断出的前景物体粗略形状计算出的辐射提示,对生成图像中的前景物体进行重合成与细化。为了保留纹理细节,我们在将辐射提示传递给 DiLightNet 之前,将其与临时合成图像的神经编码相乘。最后,在第三阶段,我们重合成背景以使其与前景物体上的光照保持一致。我们在各种文本提示和光照条件下展示并验证了我们的光照控制扩散模型。
引用
@article{arxiv.2402.11929,
title = {DiLightNet: Fine-grained Lighting Control for Diffusion-based Image Generation},
author = {Chong Zeng and Yue Dong and Pieter Peers and Youkang Kong and Hongzhi Wu and Xin Tong},
journal= {arXiv preprint arXiv:2402.11929},
year = {2024}
}
备注
Accepted to SIGGRAPH 2024. Project page: https://dilightnet.github.io/