面向文本到图像模型快速个性化的域无关调优编码器
计算机视觉与模式识别
2023-07-14 v1 图形学
机器学习
摘要
文本到图像(T2I)个性化允许用户通过在自然语言提示中结合自己的视觉概念来引导创意图像生成过程。近来,基于编码器的技术已成为一种新颖且高效的 T2I 个性化方法,减少了对多张图像和长时间训练的需求。然而,大多数现有编码器局限于单一类别域,这阻碍了它们处理多样化概念的能力。在本工作中,我们提出了一种域无关方法,无需任何专门数据集或关于个性化概念的先验信息。我们引入了一种新颖的基于对比的正则化技术,通过将预测的 token 推向其最近的现有 CLIP token,在保持对目标概念特征高保真度的同时,使预测嵌入靠近潜空间的可编辑区域。我们的实验结果证明了该方法的有效性,并展示了所学 token 比未正则化模型预测的 token 更具语义性。这带来了更好的表示,在取得最先进性能的同时比先前方法更具灵活性。
引用
@article{arxiv.2307.06925,
title = {Domain-Agnostic Tuning-Encoder for Fast Personalization of Text-To-Image Models},
author = {Moab Arar and Rinon Gal and Yuval Atzmon and Gal Chechik and Daniel Cohen-Or and Ariel Shamir and Amit H. Bermano},
journal= {arXiv preprint arXiv:2307.06925},
year = {2023}
}
备注
Project page at https://datencoder.github.io