中文

文本到图像合成的全方位条件化

计算机视觉与模式识别 2026-02-11 v1

摘要

准确解释和视觉呈现涉及多个对象、属性及空间关系的复杂提示,是文本到图像合成中的关键挑战。尽管近期取得了生成逼真输出的进展,但当前模型在处理复杂文本输入时往往难以维持语义忠实度和结构一致性。我们提出一种新方法,将文本到图像合成置于场景图结构的框架内,以提升现有模型的组合能力。尽管 prior 方法尝试通过从提示中推导的预定义布局图来解决此问题,但这些僵化约束常常限制了组合的灵活性和多样性。相反,我们引入一种零样本、基于场景图的条件化机制,在推理期间生成柔软的视觉指导。我们方法的核心是 Attribute-Size-Quantity-Location(ASQL) Conditioner,它通过轻量级语言模型产生视觉条件,并通过推理时间优化指导基于扩散的生成。这使模型能够在保持文本-图像对齐的同时,支持轻量、连贯且多样化的图像合成。

关键词

引用

@article{arxiv.2602.09165,
  title  = {All-in-One Conditioning for Text-to-Image Synthesis},
  author = {Hirunima Jayasekara and Chuong Huynh and Yixuan Ren and Christabel Acquaye and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2602.09165},
  year   = {2026}
}