中文

StyleForge: 利用双重绑定增强任意艺术风格的文本到图像合成

计算机视觉与模式识别 2024-07-18 v2 人工智能

摘要

文本到图像模型(如 Stable Diffusion)的最新进展展示了其根据自然语言提示生成视觉图像的能力。然而,由于风格属性的抽象性和多面性,现有的 DreamBooth 等方法难以捕捉任意艺术风格。我们提出了 Single-StyleForge,这是一种用于跨多种艺术风格的个性化文本到图像合成的新方法。使用大约 15 到 20 张目标风格的图像,Single-StyleForge 建立了唯一令牌标识符与目标风格广泛属性的基础绑定。此外,引入辅助图像进行双重绑定,以引导目标风格中人物等关键元素的一致表示。进一步地,我们提出了 Multi-StyleForge,通过将多个令牌绑定到部分风格属性来增强图像质量和文本对齐度。在六种不同艺术风格上的实验评估表明,以 FID、KID 和 CLIP 分数衡量,图像质量和感知保真度均有显著提升。

关键词

引用

@article{arxiv.2404.05256,
  title  = {StyleForge: Enhancing Text-to-Image Synthesis for Any Artistic Styles with Dual Binding},
  author = {Junseo Park and Beomseok Ko and Hyeryung Jang},
  journal= {arXiv preprint arXiv:2404.05256},
  year   = {2024}
}

备注

20 pages, 12 figuers