StyleDrop:任意风格下的文本到图像生成
计算机视觉与模式识别
2023-06-02 v1 人工智能
摘要
预训练的大型文本到图像模型通过恰当使用文本提示合成令人印象深刻的图像。然而,自然语言固有的歧义性和分布外效应使得合成利用特定设计图案、纹理或材料的图像风格变得困难。在本文中,我们引入StyleDrop,一种利用文本到图像模型合成忠实遵循特定风格图像的方法。所提方法极其通用,能捕捉用户所提供风格的细微差别和细节,如配色方案、阴影、设计图案以及局部和全局效果。它通过微调极少的可训练参数(少于总模型参数的)并借助人类或自动化反馈的迭代训练来提升质量,从而高效学习新风格。更好的是,即使用户仅提供指定所需风格的单张图像,StyleDrop也能给出令人印象深刻的结果。一项广泛研究表明,对于风格微调文本到图像模型的任务,在Muse上实现的StyleDrop令人信服地优于其他方法,包括Imagen或Stable Diffusion上的DreamBooth和文本反演。更多结果见我们的项目网站:https://styledrop.github.io
引用
@article{arxiv.2306.00983,
title = {StyleDrop: Text-to-Image Generation in Any Style},
author = {Kihyuk Sohn and Nataniel Ruiz and Kimin Lee and Daniel Castro Chin and Irina Blok and Huiwen Chang and Jarred Barber and Lu Jiang and Glenn Entis and Yuanzhen Li and Yuan Hao and Irfan Essa and Michael Rubinstein and Dilip Krishnan},
journal= {arXiv preprint arXiv:2306.00983},
year = {2023}
}
备注
Preprint. Project page at https://styledrop.github.io