并非所有参数都重要:掩码扩散模型以增强生成能力
计算机视觉与模式识别
2025-05-07 v1
摘要
扩散模型在早期阶段专注于构建基本图像结构,而精细细节(包括局部特征和纹理)则在后期阶段生成。因此,相同的网络层被迫同时学习结构信息和纹理信息,这与传统的深度学习架构(例如 ResNet 或 GAN)显著不同,后者在不同层捕获或生成图像语义信息。这一差异启发我们探索时间维度的扩散模型。我们初步研究了 U-Net 参数对去噪过程的关键贡献,并发现适当地将某些参数(包括大参数)置零有助于去噪,从而在运行中显著提高生成质量。利用这一发现,我们提出了一种简单而有效的方法——称为“MaskUNet”——以可忽略的参数数量增强生成质量。我们的方法充分利用了依赖于时间步和样本的有效 U-Net 参数。为了优化 MaskUNet,我们提供了两种微调策略:基于训练的方法和无训练的方法,包括定制的网络和优化函数。在 COCO 数据集上的零样本推理中,MaskUNet 取得了最佳的 FID 分数,并在下游任务评估中进一步证明了其有效性。项目页面:https://gudaochangsheng.github.io/MaskUnet-Page/
引用
@article{arxiv.2505.03097,
title = {Not All Parameters Matter: Masking Diffusion Models for Enhancing Generation Ability},
author = {Lei Wang and Senmao Li and Fei Yang and Jianye Wang and Ziheng Zhang and Yuhan Liu and Yaxing Wang and Jian Yang},
journal= {arXiv preprint arXiv:2505.03097},
year = {2025}
}
备注
Accepted to CVPR 2025