中文

揭示文本到图像扩散模型中的文本嵌入

计算机视觉与模式识别 2024-04-02 v1 人工智能

摘要

输入文本与生成图像之间的对应关系表现出不透明性,其中微小的文本修改可能导致生成图像出现显著偏差。然而,文本嵌入作为文本与图像之间的关键中介,仍相对缺乏探索。本文通过深入研究文本嵌入空间,填补了这一研究空白,在免学习框架下释放了其在可控图像编辑和可解释语义方向属性方面的能力。具体而言,我们识别了关于逐词嵌入重要性及其在文本嵌入中上下文相关性的两个关键见解,为免学习图像编辑提供了指导性原则。此外,我们发现文本嵌入本质上具有多样的语义潜力,并进一步通过奇异值分解(SVD)的视角揭示了这一特性。这些揭示出的特性为图像编辑和语义发现提供了实用价值。更重要的是,我们期望对文本嵌入的深入分析与发现能够增强对文本到图像扩散模型的理解。

关键词

引用

@article{arxiv.2404.01154,
  title  = {Uncovering the Text Embedding in Text-to-Image Diffusion Models},
  author = {Hu Yu and Hao Luo and Fan Wang and Feng Zhao},
  journal= {arXiv preprint arXiv:2404.01154},
  year   = {2024}
}