中文

Generation Navigator:面向图像生成的状态感知智能体框架

计算机视觉与模式识别 2026-05-19 v1

摘要

尽管文本到图像生成取得了快速进展,但忠实实现用户意图仍具有挑战,往往需要手动的多轮试错。为自动化此过程,现有系统依赖于简单的提示重写或由手工规则驱动的闭环智能体,而非学习适应生成过程的动态变化。在本文中,我们将图像生成重新定义为状态条件化动作制定问题,提出 Generation Navigator,一个多轮文本到图像 (T2I) 智能体,学习动态引导生成轨迹并输出下一个动作。然而,通过强化学习训练此智能体引入了一个关键信用分配挑战:仅基于单个状态对轨迹进行奖励的做法会为滚动中的所有动作分配相等的信用,忽略跨回合的质量动态,无法区分改善轨迹的动作与降低轨迹或浪费回合的动作。我们通过 PRE-GRPO (峰值-保留-效率组相对策略优化),一个显式奖励发现高质量图像(峰值)、避免后续质量退化(保留)以及最小化不必要回合(效率)的轨迹级强化学习目标来解决此问题。实验表明,在各类基准测试上实现了显著改进,在WISE 数据集上达到 0.90 的分数,在 T2I-ReasonBench 上实现 79.06% 的推理准确率。

关键词

引用

@article{arxiv.2605.17969,
  title  = {Generation Navigator: A State-Aware Agentic Framework for Image Generation},
  author = {Jinming Liu and Ruoyu Feng and Yuqi Wang and Wenjun Zeng and Xin Jin},
  journal= {arXiv preprint arXiv:2605.17969},
  year   = {2026}
}