中文

Visual-CoG:基于引导链的阶段感知强化学习用于文本到图像生成

计算机视觉与模式识别 2025-08-27 v2

摘要

尽管近期自回归模型在文本到图像(T2I)生成方面取得了可喜的进展,但它们处理多属性和模糊提示的能力仍然有限。为了解决这些局限性,现有工作应用了思维链(CoT)来实现阶段感知的视觉合成,并采用强化学习(RL)来提高推理能力。然而,大多数模型仅在生成阶段结束时提供奖励信号。这种单一的仅最终阶段指导使得难以识别哪些阶段对最终结果做出了积极贡献,并可能导致次优策略。为了解决这个问题,我们提出了一种视觉引导链(Visual-CoG)范式,包含三个阶段:语义推理、过程细化和结果评估,通过阶段感知奖励在整个图像生成流水线中提供即时指导。我们进一步构建了一个视觉认知基准 VisCog-Bench,它包含四个子任务以评估语义推理的有效性。在 GenEval、T2I-CompBench 和提出的 VisCog-Bench 上的综合评估分别显示了 15%、5% 和 19% 的提升,证明了所提出的 Visual-CoG 的优越性能。我们将很快发布所有资源。

关键词

引用

@article{arxiv.2508.18032,
  title  = {Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation},
  author = {Yaqi Li and Peng Chen and Mingyang Han and Pi Bu and Haoxiang Shi and Runzhou Zhao and Yang Yao and Xuan Zhang and Jun Song and Bo Zheng},
  journal= {arXiv preprint arXiv:2508.18032},
  year   = {2025}
}