CatVersion:面向基于扩散的文本到图像个性化的嵌入拼接方法
计算机视觉与模式识别
2023-12-01 v2
摘要
我们提出 CatVersion,一种基于反演的方法,通过少量样本学习个性化概念。随后,用户可利用文本提示生成体现个性化概念的图像,从而实现文本到图像个性化。与现有强调词嵌入学习或扩散模型参数微调(可能导致概念稀释或过拟合)的方法不同,我们的方法在扩散模型文本编码器的特征密集空间上拼接嵌入,以学习个性化概念与其基类之间的差距,旨在最大化保留扩散模型中的先验知识同时还原个性化概念。为此,我们首先剖析文本编码器在图像生成过程中的集成以识别编码器的特征密集空间。之后,我们在该空间的 Keys 和 Values 上拼接嵌入,以学习个性化概念与其基类之间的差距。如此,拼接嵌入最终表现为原始注意力输出上的残差。为了更准确且无偏地量化个性化图像生成的结果,我们基于掩码改进了 CLIP 图像对齐分数。在定性与定量上,CatVersion 有助于更忠实地还原个性化概念,并实现更鲁棒的编辑。
引用
@article{arxiv.2311.14631,
title = {CatVersion: Concatenating Embeddings for Diffusion-Based Text-to-Image Personalization},
author = {Ruoyu Zhao and Mingrui Zhu and Shiyin Dong and Nannan Wang and Xinbo Gao},
journal= {arXiv preprint arXiv:2311.14631},
year = {2023}
}
备注
For the project page, please visit https://royzhao926.github.io/CatVersion-page/