中文

通过场景去语境化实现一致文本到图像生成

计算机视觉与模式识别 2026-02-17 v2

摘要

一致文本到图像(T2I)生成旨在产生同一主体在多样化场景下的身份保持图像,但由于一种称为身份(ID)迁移的现象,往往会失败。以前的方法解决了这个问题,但通常依赖于事先知道所有目标场景的不切实际的假设。这篇论文揭示了ID迁移的关键来源是T2I模型拟合大量自然图像训练分布所自然产生的主体与场景语境之间的相关性,称为场景语境化。我们形式化地证明了这种场景-ID相关性的近普遍性,并推导了其强度的理论上限。基于此,我们提出一种新颖且高效的、无需训练的提示嵌入编辑方法,称为场景去语境化(SDeC),该方法对T2I内置的场景语境化进行逆过程。具体而言,它识别并抑制ID提示嵌入中对应特征值的场景-ID相关性,通过量化SVD方向稳定性来自适应地重新加权相应的特征值。关键的是,SDeC允许每个场景单独使用(每个提示一个场景),无需访问所有目标场景。这使得它成为高度灵活和通用的解决方案,特别适合那些通常不可用或随时间变化的先验知识的实际应用。实验表明,SDeC显著增强了身份保持,同时保持了场景多样性。

关键词

引用

@article{arxiv.2510.14553,
  title  = {Consistent text-to-image generation via scene de-contextualization},
  author = {Song Tang and Peihao Gong and Kunyu Li and Kai Guo and Boyu Wang and Mao Ye and Jianwei Zhang and Xiatian Zhu},
  journal= {arXiv preprint arXiv:2510.14553},
  year   = {2026}
}

备注

This paper is accepted by ICLR 2026