DMM:基于蒸馏模型合并的通用图像生成模型构建
计算机视觉与模式识别
2025-04-18 v1
摘要
文本到图像(T2I)生成模型的成功催生了大量在同一基础模型上针对各种专业数据集微调的模型检查点。这种海量专业模型的生产带来了高参数冗余与巨大存储成本的新挑战,因此需要开发有效方法,将多个强大模型的能力整合并统一到单一模型中。模型合并的常见做法是在参数空间中采用静态线性插值以实现风格混合的目标。然而,它忽略了 T2I 生成任务的特性,即众多不同模型涵盖各种风格,这可能导致合并模型中的不兼容与混乱。为解决此问题,我们引入了一种风格可提示的图像生成流水线,能够在风格向量的控制下准确生成任意风格的图像。基于这一设计,我们提出了基于分数蒸馏的模型合并范式(DMM),将多个模型压缩为单一的通用 T2I 模型。此外,我们在 T2I 生成的背景下重新思考并重新表述了模型合并任务,提出了新的合并目标与评估协议。我们的实验表明,DMM 能够紧凑地重组来自多个教师模型的知识,并实现可控的任意风格生成。
引用
@article{arxiv.2504.12364,
title = {DMM: Building a Versatile Image Generation Model via Distillation-Based Model Merging},
author = {Tianhui Song and Weixin Feng and Shuai Wang and Xubin Li and Tiezheng Ge and Bo Zheng and Limin Wang},
journal= {arXiv preprint arXiv:2504.12364},
year = {2025}
}