中文

ClassDiffusion:具有显式类别指导的更对齐个性化微调

计算机视觉与模式识别 2025-03-17 v3

摘要

最近的文本到图像定制工作已经证明,通过在少量样本上微调扩散模型,可以成功生成给定概念的图像。然而,基于微调的方法本质上倾向于过拟合这些概念,导致无法在多种条件下创建该概念(例如,在生成“一只戴着耳机的狗”时耳机缺失)。有趣的是,我们注意到微调前的基础模型表现出将基础概念与其他元素组合的能力(例如,“一只戴着耳机的狗”),这意味着这种组合能力仅在个性化微调后才消失。我们观察到微调后定制概念发生了语义偏移,表明个性化概念与原始概念未对齐,并通过理论分析进一步表明,这种语义偏移导致采样联合条件概率分布的难度增加,从而导致组合能力的丧失。受这一发现的启发,我们提出了 **ClassDiffusion**,这是一种利用**语义保留损失**在学习新概念时显式调节概念空间的技术。尽管简单,这种方法有效地防止了目标概念微调过程中的语义漂移。大量的定性和定量实验表明,使用语义保留损失有效地提高了微调模型的组合能力。最后,我们还将 ClassDiffusion 扩展到个性化视频生成,展示了其灵活性。

关键词

引用

@article{arxiv.2405.17532,
  title  = {ClassDiffusion: More Aligned Personalization Tuning with Explicit Class Guidance},
  author = {Jiannan Huang and Jun Hao Liew and Hanshu Yan and Yuyang Yin and Yao Zhao and Humphrey Shi and Yunchao Wei},
  journal= {arXiv preprint arXiv:2405.17532},
  year   = {2025}
}

备注

Accepted to ICLR2025, Code is available at https://github.com/Rbrq03/ClassDiffusion