中文

PreciseControl:通过细粒度属性控制增强文本到图像扩散模型

计算机视觉与模式识别 2024-08-12 v1

摘要

近年来,文本到图像(T2I)扩散模型的个性化方法激增,可利用少量图像学习一个概念。现有方法在用于人脸个性化时,难以实现具有身份保持的令人信服的反转,且依赖于对生成人脸进行基于语义文本的编辑。然而,人脸属性编辑需要更细粒度的控制,仅靠文本提示难以实现。相比之下,StyleGAN 模型学习了丰富的人脸先验,并通过潜在操作实现了向细粒度属性编辑的平滑控制。本工作利用 StyleGAN 的解耦 W+\mathcal{W+} 空间来约束 T2I 模型。该方法使我们能够精确操控人脸属性,例如平滑地引入微笑,同时保留 T2I 模型固有的基于文本的粗粒度控制能力。为实现 T2I 模型对 W+\mathcal{W+} 空间的约束,我们训练了一个潜在映射器,将 W+\mathcal{W+} 中的潜在码转换为 T2I 模型的 token 嵌入空间。所提方法在人脸图像精确反转与属性保持方面表现出色,并支持细粒度属性编辑的连续控制。此外,我们的方法可便捷地扩展至生成涉及多人的合成结果。我们进行了大量实验来验证本方法在人脸个性化和细粒度属性编辑方面的有效性。

关键词

引用

@article{arxiv.2408.05083,
  title  = {PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control},
  author = {Rishubh Parihar and Sachidanand VS and Sabariswaran Mani and Tejan Karmali and R. Venkatesh Babu},
  journal= {arXiv preprint arXiv:2408.05083},
  year   = {2024}
}

备注

ECCV 2024, Project page: https://rishubhpar.github.io/PreciseControl.home/