中文

StyleAdapter:一种统一的风格化图像生成模型

计算机视觉与模式识别 2024-10-31 v2

摘要

本工作聚焦于生成具有参考图像特定风格与所给文本描述内容的高质量图像。当前主流算法(如 DreamBooth 和 LoRA)需要对每种风格进行微调,导致耗时且计算昂贵的过程。本工作中,我们提出 StyleAdapter,一种统一的风格化图像生成模型,能够生成多样风格化图像,既匹配给定提示的内容又匹配参考图像的风格,且无需按风格微调。它引入双路交叉注意力(TPCA)模块分别处理风格信息与文本提示,并与语义抑制视觉模型(SSVM)协作以抑制风格图像的语义内容。如此可确保提示保持对生成图像内容的控制,同时减轻风格参考中语义信息的负面影响。这使得生成图像的内容遵循提示,而其风格与风格参考对齐。此外,我们的 StyleAdapter 可与现有可控合成方法(如 T2I-adapter 和 ControlNet)集成,以获得更可控且稳定的生成过程。大量实验证明了我们的方法相对于先前工作的优越性。

关键词

引用

@article{arxiv.2309.01770,
  title  = {StyleAdapter: A Unified Stylized Image Generation Model},
  author = {Zhouxia Wang and Xintao Wang and Liangbin Xie and Zhongang Qi and Ying Shan and Wenping Wang and Ping Luo},
  journal= {arXiv preprint arXiv:2309.01770},
  year   = {2024}
}

备注

Accepted by IJCV24