中文

如何持续适应文本到图像扩散模型以实现灵活定制?

计算机视觉与模式识别 2024-10-24 v1

摘要

定制扩散模型(CDMs)因其对个性化概念的惊人生成能力而受到广泛关注。然而,大多数现有的 CDMs 不合理地假设个性化概念是固定的,并且不会随时间变化。此外,在持续学习一系列新概念时,它们严重遭受对旧个性化概念的灾难性遗忘和概念忽视。为了应对这些挑战,我们提出了一种新颖的概念增量文本到图像扩散模型(CIDM),该模型可以解决灾难性遗忘和概念忽视问题,以概念增量的方式学习新的定制任务。具体来说,为了克服旧概念的灾难性遗忘,我们开发了一个概念巩固损失和一个弹性权重聚合模块。它们可以在训练过程中探索任务特定和任务共享的知识,并在推理过程中根据贡献聚合所有旧概念的低秩权重。此外,为了解决概念忽视问题,我们设计了一种上下文可控合成策略,该策略利用表达性区域特征和噪声估计,根据用户条件控制生成图像的上下文。实验证明,我们的 CIDM 超越了现有的定制扩散模型。源代码可在 https://github.com/JiahuaDong/CIFC 获取。

关键词

引用

@article{arxiv.2410.17594,
  title  = {How to Continually Adapt Text-to-Image Diffusion Models for Flexible Customization?},
  author = {Jiahua Dong and Wenqi Liang and Hongliu Li and Duzhen Zhang and Meng Cao and Henghui Ding and Salman Khan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2410.17594},
  year   = {2024}
}

备注

Accepted to NeurIPS2024