中文

EPIC:用于组合式文本到图像生成的高效谓词引导推理时控制

计算机视觉与模式识别 2026-05-13 v1 机器学习

摘要

最近的文本到图像(T2I)生成器能够合成逼真的图像,但在处理涉及多个对象、计数、属性和关系的组合式提示时仍然面临困难。我们引入了 EPIC(高效谓词引导推理时控制),这是一个无需训练、用于组合式 T2I 生成的推理时优化框架。EPIC 将优化过程视为谓词引导的搜索:它将原始提示一次性解析为一个由对象变量和类型化谓词组成的固定视觉程序,涵盖可检查的条件,如对象存在性、计数、属性和关系。每张生成或编辑的图像都根据从该图像中提取的视觉证据,对照此程序进行验证。只有当所有谓词都满足时,图像才被判定为满足提示;否则,失败的谓词决定下一步操作,将局部失败路由到目标编辑,将全局失败路由到重采样,而固定的视觉程序保持不变。在 GenEval2 基准测试上,EPIC 将使用基础生成器进行单次生成的提示级准确率从 34.16% 提高到 71.46%。在相同的生成器/编辑器设置和最大图像模型执行预算下,EPIC 比最强的先前优化基线高出 19.23 个百分点,同时将实际成本降低了 31%(图像模型执行次数)、72%(MLLM 调用次数)和 81%(每个提示的 MLLM token 数)。

关键词

引用

@article{arxiv.2605.11722,
  title  = {EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation},
  author = {Sunung Mun and Sunghyun Cho and Jungseul Ok},
  journal= {arXiv preprint arXiv:2605.11722},
  year   = {2026}
}