中文

面向文本到图像扩散模型的人像生成的参数化阴影控制

计算机视觉与模式识别 2025-04-08 v2 人工智能 图像与视频处理

摘要

文本到图像扩散模型在生成多样化人像方面表现出色,但缺乏直观的阴影控制。现有编辑方法作为后处理,难以在不同风格之间提供有效的操控。此外,这些方法要么依赖昂贵的真实世界灯光舞台数据收集,要么需要大量计算资源进行训练。为克服这些限制,我们提出了 Shadow Director 方法,从训练好的扩散模型中提取并操控隐藏的阴影属性。我们的做法使用一个小型估计网络,只需数千张合成图像和数小时训练——无需昂贵的真实世界灯光舞台数据。Shadow Director 实现了在人像生成期间对阴影形状、位置和强度进行参数化和直观控制,同时在不同风格下保持艺术性和身份识别。尽管仅在基于真实世界身份识别的合成数据上进行训练,但它对风格多样化的生成人像具有良好的泛化能力,使其成为更具可达性和资源友好型的解决方案。

关键词

引用

@article{arxiv.2503.21943,
  title  = {Parametric Shadow Control for Portrait Generation in Text-to-Image Diffusion Models},
  author = {Haoming Cai and Tsung-Wei Huang and Shiv Gehlot and Brandon Y. Feng and Sachin Shah and Guan-Ming Su and Christopher Metzler},
  journal= {arXiv preprint arXiv:2503.21943},
  year   = {2025}
}

备注

ShadowDirector Arxiv Version. Fix the arxiv title text issue