StyleForge: 利用双重绑定增强任意艺术风格的文本到图像合成
计算机视觉与模式识别
2024-07-18 v2 人工智能
摘要
文本到图像模型(如 Stable Diffusion)的最新进展展示了其根据自然语言提示生成视觉图像的能力。然而,由于风格属性的抽象性和多面性,现有的 DreamBooth 等方法难以捕捉任意艺术风格。我们提出了 Single-StyleForge,这是一种用于跨多种艺术风格的个性化文本到图像合成的新方法。使用大约 15 到 20 张目标风格的图像,Single-StyleForge 建立了唯一令牌标识符与目标风格广泛属性的基础绑定。此外,引入辅助图像进行双重绑定,以引导目标风格中人物等关键元素的一致表示。进一步地,我们提出了 Multi-StyleForge,通过将多个令牌绑定到部分风格属性来增强图像质量和文本对齐度。在六种不同艺术风格上的实验评估表明,以 FID、KID 和 CLIP 分数衡量,图像质量和感知保真度均有显著提升。
引用
@article{arxiv.2404.05256,
title = {StyleForge: Enhancing Text-to-Image Synthesis for Any Artistic Styles with Dual Binding},
author = {Junseo Park and Beomseok Ko and Hyeryung Jang},
journal= {arXiv preprint arXiv:2404.05256},
year = {2024}
}
备注
20 pages, 12 figuers