InstantStyle:文本到图像生成中风格保持的免费午餐
计算机视觉与模式识别
2024-04-08 v2
摘要
免调优的扩散模型在图像个性化和定制领域已显示出巨大潜力。然而,尽管取得了显著进展,当前模型在生成风格一致的图像时仍面临若干复杂挑战。首先,风格的概念本质上是欠定的,包含颜色、材质、氛围、设计和结构等多种元素。其次,基于反转的方法容易导致风格退化,常常丢失细粒度细节。最后,基于适配器的方法通常需要对每个参考图像进行精细的权重调整,以在风格强度和文本可控性之间取得平衡。在本文中,我们首先考察了几个引人注目但经常被忽视的观察结果。然后,我们介绍了InstantStyle,一个旨在通过实施两个关键策略来解决这些问题的框架:1)一种简单的机制,在特征空间中将参考图像的风格和内容解耦,基于同一空间中的特征可以相互加减的假设。2)仅将参考图像特征注入到风格特定块中,从而防止风格泄漏并避免繁琐的权重调整,而这通常是参数更重的设计的特点。我们的工作展示了卓越的视觉风格化效果,在风格强度和文本元素可控性之间取得了最佳平衡。我们的代码将在https://github.com/InstantStyle/InstantStyle提供。
引用
@article{arxiv.2404.02733,
title = {InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation},
author = {Haofan Wang and Matteo Spinelli and Qixun Wang and Xu Bai and Zekui Qin and Anthony Chen},
journal= {arXiv preprint arXiv:2404.02733},
year = {2024}
}
备注
Technical Report