中文

MuseumMaker:持续风格定制且不发生灾难性遗忘

计算机视觉与模式识别 2024-04-30 v2

摘要

具有合适文本提示的预训练大型文本到图像(T2I)模型在定制化图像生成领域引发了越来越多的关注。然而,灾难性遗忘问题使得在不断合成新的用户提供风格时难以保留已学习风格中令人满意的结果。在本文中,我们提出了 MuseumMaker 方法,使其能够持续地通过一组定制化风格来合成图像,并逐渐将这些创意艺术作品累积为一个博物馆。当面对新的定制化风格时,我们开发了风格蒸馏损失模块,用于提取和学习新图像生成的训练数据的风格。这可以最小化由新训练图像内容引起的学习偏差,并解决由少样本图像引起的灾难性过拟合问题。为了处理过去已学习风格之间的灾难性遗忘,我们设计了用于共享 LoRA 模块的双重正则化,以优化模型更新的方向,这可以分别从权重和特征方面对扩散模型进行正则化。同时,为了进一步保留过去风格的历史知识并解决 LoRA 的有限表征能力问题,我们考虑任务级 token 学习模块,其中学习唯一的 token 嵌入来表示新风格。当任何新的用户提供风格出现时,MuseumMaker 都能捕捉到新风格的细微差别,同时保持已学习风格的细节。 diverse style 数据集上的实验结果验证了我们提出的 MuseumMaker 方法的有效性,展示了其在各种场景下的鲁棒性和通用性。

关键词

引用

@article{arxiv.2404.16612,
  title  = {MuseumMaker: Continual Style Customization without Catastrophic Forgetting},
  author = {Chenxi Liu and Gan Sun and Wenqi Liang and Jiahua Dong and Can Qin and Yang Cong},
  journal= {arXiv preprint arXiv:2404.16612},
  year   = {2024}
}