中文

FiRe:用于增强图像生成的细粒度多模态推理

计算机视觉与模式识别 2026-05-27 v3

摘要

随着多模态大语言模型(MLLMs)的快速发展,能够联合完成图像理解与生成的统一型 MLLMs 取得了显著进展。然而,尽管统一型 MLLMs 拥有自我反思与自我优化的推理能力,但其在文本到图像生成中的应用仍 largely 未被探索。此外,现有的基于多模态推理的图像生成方法大多依赖提示词增强或整体图像-文本对齐判断,缺乏对详细提示属性的细粒度反思与优化,导致细粒度控制受限。为解决此限制,我们提出了 FiRe,即一种用于增强图像生成的细粒度多模态推理方法。具体而言,FiRe 通过首先将提示词分解为关键视觉要求,再对生成图像中这些要求的满足情况进行自我判断,随后根据自生成的精确反馈进行局部优化。此外,为进一步强化 MLLM 的多模态推理能力,我们引入FiRe-GRPO,即一种针对 FiRe 的强化学习方法。由于标准的群相对政策优化(GRPO)在多步骤推理中 suffers from 稀疏、基于结果的奖励,我们将推理过程形式化为步骤级别的决策问题,设计步骤特定的奖励,并在 GRPO 框架下计算步骤级别的优势,以实现细粒度信用分配。大量实验表明,FiRe 在对抗性的文本到图像基准中 consistently 优于现有的文本到图像基线方法,尤其在组合文本到图像基准上取得了显著提升。

关键词

引用

@article{arxiv.2604.13491,
  title  = {FiRe: Fine-grained Multimodal Reasoning for Enhanced Image Generation},
  author = {Yongjin Kim and Yoonjin Oh and Yerin Kim and Hyomin Kim and Jeeyoung Yun and Yujung Heo and Minjun Kim and Sungwoong Kim},
  journal= {arXiv preprint arXiv:2604.13491},
  year   = {2026}
}