Diff-Plugin:用于扩散模型低层次任务中细节恢复的框架
计算机视觉与模式识别
2024-05-29 v4
摘要
在大规模数据集上训练的扩散模型在图像合成方面取得了显著进展。然而,由于扩散过程中的随机性,这些模型往往难以处理需要保留细节的多样化低层次任务。为克服这一限制,我们提出了新的 Diff-Plugin 框架,使单个预训练扩散模型能够在多种低层次任务中生成高保真结果。具体而言,我们首先提出了具有双分支设计的轻量级任务插件模块,提供任务特定的先验信息,引导扩散过程保留图像内容。随后,我们提出了插件选择器(Plugin-Selector),可根据文本指令自动选择不同的任务插件,允许用户通过自然语言指示多个低层次任务来编辑图像。我们在 8 项低层视觉任务上进行了大量实验。结果表明,Diff-Plugin 在现实场景下的优势显著,尤其在处理复杂任务时表现更为出色。我们的消融实验进一步验证了 Diff-Plugin 在不同数据集规模下的稳定性、可调性以及鲁棒训练能力。
引用
@article{arxiv.2403.00644,
title = {Diff-Plugin: Revitalizing Details for Diffusion-based Low-level Tasks},
author = {Yuhao Liu and Zhanghan Ke and Fang Liu and Nanxuan Zhao and Rynson W. H. Lau},
journal= {arXiv preprint arXiv:2403.00644},
year = {2024}
}
备注
Accepted to CVPR2024. Replaced some celebrity images to avoid copyright disputes