中文

PaRa:基于参数秩约简的文本到图像扩散模型个性化方法

计算机视觉与模式识别 2024-06-11 v1

摘要

对大规模预训练文本到图像(T2I)扩散模型进行个性化通常面临在保持训练数据分布与目标分布之间取得恰当平衡的挑战,即仅凭少量目标图像学习新概念以实现个性化(与个性化目标对齐)同时保持文本可编辑性(与多样化文本提示对齐)。本文提出了PaRa,一种有效且高效的参数秩约简方法,用于T2I模型个性化,通过显式控制扩散模型参数的秩,将其初始的多样化生成空间限制在小而均衡的目标空间内。我们的设计动因是,针对特定艺术风格等新型概念意味着较小的生成空间。通过在微调期间降低模型参数的秩,可以有效地将去噪采样轨迹的空间限制在目标方向。通过全面实验,我们展示了PaRa在单主体/多主体生成以及单图像编辑方面相对于现有微调方法具有显著优势。值得注意的是,与主流微调技术LoRA相比,PaRa在参数效率上更佳(可学习参数减少2倍),且在目标图像对齐方面表现更佳。

关键词

引用

@article{arxiv.2406.05641,
  title  = {PaRa: Personalizing Text-to-Image Diffusion via Parameter Rank Reduction},
  author = {Shangyu Chen and Zizheng Pan and Jianfei Cai and Dinh Phung},
  journal= {arXiv preprint arXiv:2406.05641},
  year   = {2024}
}