中文

用于创意与反事实文本到图像合成的自动提示生成

计算机视觉与模式识别 2025-09-29 v1 人工智能

摘要

文本到图像生成技术近期在大规模多模态训练方面取得了快速进展,但细粒度的可控性仍是关键挑战。其中,反事实可控性(counterfactual controllability),即有意生成违反常识模式的图像的能力,至关重要且在促进创意和探索性应用中发挥关键作用。本文聚焦于反事实尺寸(如生成一只小象旁边有巨型按钮)的自动提示工程框架,将基础提示词转化为反事实图像的修订提示词。该框架包含三个组件:一个图像评估器,通过识别成功的图像生成来指导数据集构建;一个监督式提示词重写器,用于生成修订后的提示词;以及一个训练 DPO 的排序器,用于筛选最优的修订提示词。我们构建了首个反事实尺寸文本-图像数据集,并通过扩展 Grounded SAM 并进行优化,使图像评估器相较于基线提升了 114%。实验表明,我们的方法超越了最先进的基线方法和 ChatGPT-4o,为未来反事实可控性研究奠定了基础。

关键词

引用

@article{arxiv.2509.21375,
  title  = {Automated Prompt Generation for Creative and Counterfactual Text-to-image Synthesis},
  author = {Aleksa Jelaca and Ying Jiao and Chang Tian and Marie-Francine Moens},
  journal= {arXiv preprint arXiv:2509.21375},
  year   = {2025}
}

备注

text-to-image generation, automatic prompt, DPO, Counterfactual