中文

扩散汤:文本到图像扩散模型的模型合并

计算机视觉与模式识别 2024-06-13 v1 人工智能 密码学与安全 机器学习

摘要

我们提出了 Diffusion Soup,这是一种用于文本到图像生成的 compartmentalization 方法,通过对在分片数据上训练的扩散模型权重进行平均。通过这种方法的构建,我们实现了训练-free 持续学习与遗忘,无需额外内存或推理成本,因为对应的模型分片可通过重新平均来添加或移除。我们表明,Diffusion Soup 从权空间中采样的点近似于组成数据分布的几何平均值,这提供了反记忆保证,使零-shot 风格混合成为可能。经验上,Diffusion Soup 在域分片数据上超过了在所有数据分片联合训练的典范模型,在 Image Reward 上提升 30%(.34 → .44),在 aesthetic 数据上提升 59%(.37 → .59)。在两种情况下,souping 也在 TIFA 分数上表现突出(分别从 85.5 → 86.5 和 85.6 → 86.8)。我们展示了稳健的遗忘——仅移除单个领域分片,IR 性能仅下降 1%(.45 → .44)——并通过真实数据验证了反记忆的理论见解。最后,我们展示了 Diffusion Soup 融合不同分片上微调模型风格的能力,实现零-shot 混合风格的生成。

关键词

引用

@article{arxiv.2406.08431,
  title  = {Diffusion Soup: Model Merging for Text-to-Image Diffusion Models},
  author = {Benjamin Biggs and Arjun Seshadri and Yang Zou and Achin Jain and Aditya Golatkar and Yusheng Xie and Alessandro Achille and Ashwin Swaminathan and Stefano Soatto},
  journal= {arXiv preprint arXiv:2406.08431},
  year   = {2024}
}