中文

VisualPrompter:用于文本到图像合成的语义感知提示优化

计算机视觉与模式识别 2026-03-09 v2

摘要

用户提供提示词与模型偏好提示词之间的显著差距是高质量图像生成的重要挑战,迫切需要提示工程。当前的提示工程研究在有效提升生成图像的风格与美学方面具有成效,但往往忽视生成图像与用户描述之间的语义对齐,导致生成视觉上令人满意但内容上不符用户期望的输出。本文提出VisualPrompter,一种新颖的无训练提示工程框架,用于细化用户输入以匹配模型偏好。VisualPrompter利用自动自我反思模块识别生成图像中缺失的概念,随后采用目标特定的提示优化机制进行细粒度修订。通过解构提示词,在原子语义层面引入新元素并重新组装,本框架能够在优化过程中保持语义一致性与完整性。大量实验表明,VisualPrompter在文本-图像对齐评估多个基准上实现了新的状态最佳性能。此外,本框架采用即插即用设计,具有高度适应性,可适用于各种生成模型。我们的代码已公开:https://github.com/teheperinko541/VisualPrompter。

关键词

引用

@article{arxiv.2506.23138,
  title  = {VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis},
  author = {Shiyu Wu and Mingzhen Sun and Weining Wang and Yequan Wang and Jing Liu},
  journal= {arXiv preprint arXiv:2506.23138},
  year   = {2026}
}

备注

ICLR2026 Camera Ready