中文

Maestro:通过智能体编排实现文本到图像生成的自优化

人工智能 2025-09-16 v1 计算机视觉与模式识别

摘要

文本到图像(T2I)模型虽然提供了巨大的创作潜力,但高度依赖人工干预,带来了显著的可用性挑战,常常需要对描述不足的提示词进行繁琐的迭代式提示工程。本文介绍了 Maestro,一种新颖的自进化图像生成系统,它使 T2I 模型能够仅通过一个初始提示词,自主地通过提示词的迭代进化来优化生成的图像。Maestro 包含两项关键创新:1)自我批判,其中专门的多模态大语言模型(MLLM)智能体充当“评论家”,识别生成图像中的弱点,纠正描述不足的问题,并提供可解释的编辑信号,随后由“验证者”智能体在保留用户意图的同时整合这些信号;2)自我进化,利用 MLLM 作为评判者,对迭代生成的图像进行直接对比,摒弃有问题的图像,并进化出符合用户意图的创意提示词候选。在黑盒模型上进行的复杂 T2I 任务的大量实验表明,Maestro 相较于初始提示词和最先进的自动化方法,显著提升了图像质量,其有效性随着更先进的 MLLM 组件的使用而增强。这项工作为自优化的 T2I 生成提供了一条稳健、可解释且有效的途径。

关键词

引用

@article{arxiv.2509.10704,
  title  = {Maestro: Self-Improving Text-to-Image Generation via Agent Orchestration},
  author = {Xingchen Wan and Han Zhou and Ruoxi Sun and Hootan Nakhost and Ke Jiang and Rajarishi Sinha and Sercan Ö. Arık},
  journal= {arXiv preprint arXiv:2509.10704},
  year   = {2025}
}

备注

15 pages, 7 figures, 2 tables (22 pages, 9 figures and 3 tables including references and appendices)