中文

图像即一切:赋能大规模扩散模型进行域内生成

计算机视觉与模式识别 2025-03-21 v2 人工智能 多媒体

摘要

域内生成旨在特定领域内执行多种任务,例如无条件生成、文本到图像、图像编辑、3D生成等。早期研究通常需要为每个独特任务和领域训练专门的生成器,且往往依赖完全标注的数据。受扩散模型强大生成能力和广泛应用前景的驱动,我们致力于探索利用无标签数据来赋能这些模型进行域内生成。在领域数据上微调预训练生成模型是一种直观但具有挑战性的方法,通常需要复杂的手动超参数调整,因为训练数据的有限多样性很容易破坏模型原有的生成能力。为解决这一挑战,我们提出了一种引导解耦的先验保持机制,仅通过图像数据实现高生成质量和可控性,其灵感来源于从去噪引导角度保持预训练模型。我们将领域相关引导与无分类器引导机制中使用的条件引导解耦,以保留预训练模型的开放世界控制引导和无条件引导。我们进一步提出了一种高效的领域知识学习技术,通过训练一个额外的无文本UNet副本来预测领域引导。此外,我们从理论上阐述了一个适用于多种生成任务的多引导域内生成流程,利用来自不同扩散模型和条件的多种引导。大量实验证明了我们的方法在领域特定合成中的优越性,及其与各种基于扩散的控制方法和应用的兼容性。

关键词

引用

@article{arxiv.2312.08195,
  title  = {Image is All You Need to Empower Large-scale Diffusion Models for In-Domain Generation},
  author = {Pu Cao and Feng Zhou and Lu Yang and Tianrui Huang and Qing Song},
  journal= {arXiv preprint arXiv:2312.08195},
  year   = {2025}
}

备注

Accepted to CVPR2025. Code is available at https://github.com/PRIV-Creation/In-domain-Generation-Diffusion