DiffuseKronA:一种用于个性化扩散模型的参数高效微调方法
计算机视觉与模式识别
2024-02-29 v2
摘要
在主体驱动的文本到图像(T2I)生成模型领域,DreamBooth 和 BLIP-Diffusion 等最新进展取得了令人印象深刻的结果,但由于其密集的微调需求和大量的参数要求而面临局限性。虽然 DreamBooth 中的低秩自适应(LoRA)模块减少了可训练参数,但它引入了对超参数的高度敏感性,导致参数效率与 T2I 个性化图像合成质量之间的妥协。针对这些限制,我们引入了\textbf{\textit{DiffuseKronA}},这是一种基于克罗内克积的新型自适应模块,它不仅相比 LoRA-DreamBooth 和原始 DreamBooth 分别显著减少了 35\% 和 99.947\% 的参数量,还提升了图像合成质量。至关重要的是,\textit{DiffuseKronA} 缓解了超参数敏感性问题,在广泛的超参数范围内提供一致的高质量生成,从而减少了对广泛微调的需求。此外,更可控的分解使得\textit{DiffuseKronA} 更具可解释性,甚至能在结果与 LoRA-DreamBooth 相当的情况下实现高达 50\% 的缩减。在与多样且复杂的输入图像和文本提示进行评估时,\textit{DiffuseKronA} 始终优于现有模型,生成了具有更高保真度和更准确物体颜色分布的多样化高质量图像,同时保持了卓越的参数效率,从而代表了 T2I 生成建模领域的重大进步。我们的项目页面(包含代码和预训练检查点链接)可在 https://diffusekrona.github.io/ 获取。
引用
@article{arxiv.2402.17412,
title = {DiffuseKronA: A Parameter Efficient Fine-tuning Method for Personalized Diffusion Models},
author = {Shyam Marjit and Harshit Singh and Nityanand Mathur and Sayak Paul and Chia-Mu Yu and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2402.17412},
year = {2024}
}
备注
Project Page: https://diffusekrona.github.io/