中文

FreeTuner: 任意主题任意风格的无训练扩散

计算机视觉与模式识别 2024-05-28 v2

摘要

随着扩散模型的进步,各种个性化图像生成方法被提出。然而,几乎所有现有工作只关注主题驱动或风格驱动的个性化。同时,最先进的方法在实现组合个性化(即组合不同主题和风格概念)时面临若干挑战,如概念解耦、统一重建范式和训练数据不足。为了解决这些问题,我们引入了FreeTuner,一种灵活且无需训练的组合个性化方法,可以以任何用户提供的风格生成任何用户提供的主题(见图1)。我们的方法采用解耦策略,将生成过程分为两个阶段,以有效缓解概念纠缠。FreeTuner利用扩散模型中的中间特征进行主题概念表示,并引入风格引导来使合成图像与风格概念对齐,确保主题结构和风格美学特征的保留。大量实验证明了FreeTuner在各种个性化设置下的生成能力。

关键词

引用

@article{arxiv.2405.14201,
  title  = {FreeTuner: Any Subject in Any Style with Training-free Diffusion},
  author = {Youcan Xu and Zhen Wang and Jun Xiao and Wei Liu and Long Chen},
  journal= {arXiv preprint arXiv:2405.14201},
  year   = {2024}
}