Decouple-Then-Merge:将扩散模型微调作为多任务学习
计算机视觉与模式识别
2025-03-17 v2 人工智能
摘要
扩散模型通过学习噪声破坏序列的逆过程进行训练。通常,模型参数在多个时间步上完全共享,以提高训练效率。然而,由于每个时间步的去噪任务不同,不同时间步计算的梯度可能相互冲突,潜在降低图像生成整体性能。为解决此问题,本工作提出了Decouple-then-Merge(DeMe)框架,该框架以预训练模型为起点,对针对特定时间步微调的独立模型进行训练。我们在微调阶段引入了若干改进技术,以促进跨时间步有效知识共享,同时最小化训练干扰。最后,在微调后,这些独立模型可合并到单个模型的参数空间中,确保高效且实用的推理。实验结果表明,在COCO30K、ImageNet1K、PartiPrompts以及DDPM在LSUN Church、LSUN Bedroom和CIFAR10上的6个基准测试中,本方法显著提高了生成质量。代码已公开于GitHub。
引用
@article{arxiv.2410.06664,
title = {Decouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning},
author = {Qianli Ma and Xuefei Ning and Dongrui Liu and Li Niu and Linfeng Zhang},
journal= {arXiv preprint arXiv:2410.06664},
year = {2025}
}
备注
Accepted by CVPR2025