GenPilot:面向图像生成的测试时提示优化的多智能体系统
计算机视觉与模式识别
2025-10-09 v1 人工智能
摘要
文本到图像合成取得了显著进展,但准确理解复杂且冗长的提示仍具有挑战,常导致语义不一致和细节缺失。现有方法如微调依赖模型特定,需进行训练;而先前的自动提示优化(APO)方法通常缺乏系统的错误分析和细化策略,导致可靠性和有效性有限。同时,测试时扩展方法针对固定提示及噪声或样本数,限制了其可解释性和适应性。为此,我们提出一种灵活且高效的测试时提示优化策略,直接作用于输入文本。我们提出一种即插即用的多智能体系统 GenPilot,集成错误分析、基于聚类的自适应探索、细粒度验证以及用于迭代优化的记忆模块。该方法模型无关、可解释,尤适用于处理长且复杂的提示。同时,我们总结了常见错误模式和细化策略,提供经验并鼓励进一步探索。在 DPG-bench 和 Geneval 上的实验显示,方法在提升生成图像的文本与图像一致性和结构连贯性方面成效显著,最高可达16.9%和5.7%的提升,彰显了测试时提示优化策略的强大能力。代码已公开于 https://github.com/27yw/GenPilot。
引用
@article{arxiv.2510.07217,
title = {GenPilot: A Multi-Agent System for Test-Time Prompt Optimization in Image Generation},
author = {Wen Ye and Zhaocheng Liu and Yuwei Gui and Tingyu Yuan and Yunyue Su and Bowen Fang and Chaoyang Zhao and Qiang Liu and Liang Wang},
journal= {arXiv preprint arXiv:2510.07217},
year = {2025}
}
备注
30 pages, 21 figures, accepted to EMNLP 2025 findings