中文

基于几何视角的文本嵌入解缠:用于单提示下的主题一致文本到图像生成

计算机视觉与模式识别 2026-01-01 v3

摘要

文本到图像扩散模型在从自然语言描述生成高质量图像方面表现突出,但常常难以在多个输出之间保持主题一致性,限制了其在视觉叙事中的应用。现有方法依赖模型微调或图像条件化,计算代价高昂且需要针对每个主题进行优化。1Prompt1Story 通过将所有场景描述拼接为单个提示并对 token 嵌入进行比例缩放,但因语义泄漏(semantic leakage),导致帧之间嵌入被解缠,引发文本错位。本文提出一种从几何视角出发的简单而有效的训练-free 方法,通过细化文本嵌入来抑制不必要的语义。广泛实验表明,我们的方法显著提升了主题一致性和文本对齐性。

关键词

引用

@article{arxiv.2512.16443,
  title  = {Geometric Disentanglement of Text Embeddings for Subject-Consistent Text-to-Image Generation using A Single Prompt},
  author = {Shangxun Li and Youngjung Uh},
  journal= {arXiv preprint arXiv:2512.16443},
  year   = {2026}
}