面向个性化文本到图像生成的交叉初始化方法
计算机视觉与模式识别
2023-12-27 v1
摘要
近年来,得益于预训练文本到图像扩散模型的先进能力,人脸个性化技术激增。其中,一种显著的方法是文本反演,它通过将给定图像反演为文本嵌入来生成个性化图像。然而,基于文本反演的方法在平衡重建质量和可编辑性之间的权衡方面仍然存在困难。在本研究中,我们从初始化的角度审视这一问题。仔细检查传统初始化方法后,我们发现初始嵌入与学习到的嵌入在尺度和方向上存在显著差异。学习到的嵌入的尺度可能比初始嵌入大100倍。嵌入的这种显著变化可能增加过拟合的风险,从而损害可编辑性。基于这一观察,我们引入了一种新颖的初始化方法,称为交叉初始化,它显著缩小了初始嵌入与学习到的嵌入之间的差距。该方法不仅提高了重建质量和可编辑性,还将优化步骤从5000步减少到320步。此外,我们应用了一个正则化项来使学习到的嵌入接近初始嵌入。我们证明,当与交叉初始化结合时,该正则化项可以有效提高可编辑性。我们提供了全面的实证证据,证明我们的方法相比基线方法具有优越性能。值得注意的是,在我们的实验中,交叉初始化是唯一成功编辑个体面部表情的方法。此外,我们方法的快速版本可以在大约26秒内捕获输入图像,同时在重建质量和可编辑性方面均超越基线方法。代码将公开提供。
引用
@article{arxiv.2312.15905,
title = {Cross Initialization for Personalized Text-to-Image Generation},
author = {Lianyu Pang and Jian Yin and Haoran Xie and Qiping Wang and Qing Li and Xudong Mao},
journal= {arXiv preprint arXiv:2312.15905},
year = {2023}
}