MagicNaming:通过在T2I扩散模型中寻找“名称空间”实现一致的身份生成
计算机视觉与模式识别
2024-12-20 v1
摘要
大规模文本到图像扩散模型(如DALL-E、SDXL)能够仅通过引用其名称即可生成著名人物。是否可能让模型像生成著名人物一样简单地生成通用身份,例如仅使用一个名称?本文探讨了是否存在“名称空间”,其中空间中的任何点都对应于特定身份。幸运的是,我们在由文本嵌入组成的特征空间中找到了一些线索。具体而言,我们首先提取Laion5B数据集中著名人物名称的嵌入,并使用扩散模型的文本编码器。这些嵌入用作监督信息,用于学习一个编码器,能够预测给定面部图像的名称(实际上是一个嵌入)。我们通过实验发现,这些名称嵌入在预测生成图像时表现良好,能够保证身份的一致性。需要注意的是,像著名人物的名称一样,我们预测的名称嵌入与文本输入的语义是解耦合的,这使原始文本到图像模型的生成能力得以保留。此外,通过仅插入这些名称嵌入,所有派生自相同基础模型(即SDXL)的变体(例如来自Civitai的模型)都能轻松地变成身份感知的文本到图像模型。项目主页:\url{https://magicfusion.github.io/MagicNaming/}。
引用
@article{arxiv.2412.14902,
title = {MagicNaming: Consistent Identity Generation by Finding a "Name Space" in T2I Diffusion Models},
author = {Jing Zhao and Heliang Zheng and Chaoyue Wang and Long Lan and Wanrong Hunag and Yuhua Tang},
journal= {arXiv preprint arXiv:2412.14902},
year = {2024}
}
备注
Accepted by AAAI 2025