DreamBlend:文本到图像扩散模型个性化微调的新方法
计算机视觉与模式识别
2024-12-02 v1 图形学
机器学习
摘要
给定少量主题图像,个性化图像生成技术可对大型预训练文本到图像扩散模型进行微调,以生成该主题在新情境下的图像,受文本提示控制。在此过程中,在提示保真度、主题保真度与多样性之间进行权衡。随着预训练模型的微调,早期检查点会生成保真度低但提示保真度和多样性高的图像;相比之下,后期检查点生成保真度低且多样性差的图像,但主题保真度高。这种固有的权衡限制了生成图像的提示保真度、主题保真度与多样性。本文提出DreamBlend,通过在推理阶段结合早期检查点的提示保真度与后期检查点的主题保真度。我们对后期检查点生成的图像进行跨注意力引导,从而由早期检查点为同一提示生成的图像所引导。此举可在具有挑战性的提示下,生成保真度更高、提示保真度更高且多样性更好的图像,超越当前最先进的微调方法。
引用
@article{arxiv.2411.19390,
title = {DreamBlend: Advancing Personalized Fine-tuning of Text-to-Image Diffusion Models},
author = {Shwetha Ram and Tal Neiman and Qianli Feng and Andrew Stuart and Son Tran and Trishul Chilimbi},
journal= {arXiv preprint arXiv:2411.19390},
year = {2024}
}
备注
Accepted to WACV 2025