中文

Diffusion Cocktail: 混合领域特定扩散模型以实现多样化图像生成

计算机视觉与模式识别 2024-09-10 v2 人工智能

摘要

扩散模型具备高质量图像生成能力,因其易于扩展而获得无与伦比的普及。活跃的用户通过在自行收集的数据集上微调基础模型,创建了大量领域特定的扩散模型。近期工作侧重于通过揭示编码在各种架构组件中的语义和视觉信息来改进单一扩散模型。然而,这些方法忽略了大量可用的微调扩散模型,从而错失了利用其组合能力进行新颖生成的机会。在本工作中,我们提出 Diffusion Cocktail (Ditail),一种无训练方法,可在多个扩散模型之间传递风格和内容信息。这使我们能够使用一组扩散模型进行多样化生成,产生单一模型无法获得的新颖图像。Ditail 还提供了对生成过程的细粒度控制,从而实现对风格和内容的灵活操控。凭借这些特性,Ditail 在众多应用中表现出色,包括扩散模型引导的风格迁移、新颖风格图像生成,以及通过提示或拼贴输入进行图像操控。

关键词

引用

@article{arxiv.2312.08873,
  title  = {Diffusion Cocktail: Mixing Domain-Specific Diffusion Models for Diversified Image Generations},
  author = {Haoming Liu and Yuanhe Guo and Shengjie Wang and Hongyi Wen},
  journal= {arXiv preprint arXiv:2312.08873},
  year   = {2024}
}

备注

Project Page: https://maps-research.github.io/Ditail/