中文

稳定的艺术家:在扩散隐空间中对语义进行引导

计算机视觉与模式识别 2023-06-01 v3 人工智能 机器学习

摘要

大型文本条件生成扩散模型近期因仅从文本生成高保真图像的出色表现而备受关注。然而,以一次性方式获得高质量结果几乎不可行。相反,文本引导图像生成需要用户多次对输入进行细微修改,以迭代方式雕琢出预期图像。但输入提示的细微改动常导致生成完全不同的图像,因而艺术家的控制粒度有限。为提供灵活性,我们提出 Stable Artist,一种支持对图像生成过程进行细粒度控制的图像编辑方法。其核心组件为语义引导(SEGA),它沿可变数量的语义方向引导扩散过程。这允许对图像进行微妙编辑、改变构图与风格,并优化整体艺术构思。此外,SEGA 能够探测隐空间以洞察模型所学概念的表示,即便是如“碳排放”这样的复杂概念。我们在多个任务上演示了 Stable Artist,展示了高质量的图像编辑与构图能力。

关键词

引用

@article{arxiv.2212.06013,
  title  = {The Stable Artist: Steering Semantics in Diffusion Latent Space},
  author = {Manuel Brack and Patrick Schramowski and Felix Friedrich and Dominik Hintersdorf and Kristian Kersting},
  journal= {arXiv preprint arXiv:2212.06013},
  year   = {2023}
}

备注

This is a report of preliminary results. A full version of the paper is available at: arXiv:2301.12247