中文

CoRe:用于文本到图像个性化的上下文正则化文本嵌入学习

计算机视觉与模式识别 2024-08-29 v1

摘要

近期的文本到图像个性化技术已实现了对用户提供概念的高质量且可控图像合成,但现有方法仍难以在身份保持与文本对齐之间取得平衡。我们的做法基于这样一种事实:生成与提示词对齐的图像需要对提示词中新概念与其周围上下文记事之间的相互作用进行精确的语义理解,这涉及对CLIP文本编码器中上下文记事输出向量的准确处理。为此,我们旨在将新概念正确嵌入文本编码器的输入嵌入空间,以实现与现有记事的无缝集成。我们引入上下文正则化(CoRe),通过正则化提示词中的上下文记事来增强对新概念文本嵌入的学习。这是基于这样一种洞见:只有当新概念的文本嵌入被正确学习时,才能实现上下文记事的适当输出向量。CoRe可用于任意提示词,而无需生成对应的图像,从而提高所学文本嵌入的泛化能力。此外,CoRe还可作为一种测试时优化技术,用于进一步提升特定提示词的生成效果。全面实验表明,我们的方法在身份保持和文本对齐方面均优于多个基线方法。代码将公开 release。

关键词

引用

@article{arxiv.2408.15914,
  title  = {CoRe: Context-Regularized Text Embedding Learning for Text-to-Image Personalization},
  author = {Feize Wu and Yun Pang and Junyi Zhang and Lianyu Pang and Jian Yin and Baoquan Zhao and Qing Li and Xudong Mao},
  journal= {arXiv preprint arXiv:2408.15914},
  year   = {2024}
}