基准化与演进 R^3:面向反思性视觉生成
计算机视觉与模式识别
2026-05-20 v1
摘要
文本到图像 (T2I) 模型和统一多模态模型 (UMMs) 在视觉生成方面取得了显著进展。然而,它们依赖单次生成范式,限制了处理需要迭代细化的复杂提示的能力。为实现多轮反思性视觉生成 (RVG),我们将 Reason-Reflect-Rectify (R^3) 循环 formalize 为核心框架,引入 R^3-Bench,包含超过600个专家标注实例,量化迭代推理与纠正能力。在 R^3-Bench 上评估发现,一个关键差距:虽然最先进的模型能够识别生成错误,但无法生成可操作的纠正指令。为弥合这一差距,我们提出 R^3-Refiner,一个基于群相对政策优化 (GRPO) 和层次奖励机制 (HRM) 的双阶段框架,以更好地实现纠正与反思推理的对齐。实验表明,R^3-Refiner 在 R^3-Bench 上取得显著提升(反思 verdict 分数提升 12.0%,纠正分数提升 9.0%),可无缝集成到各种多模态大语言模型中,以提升不同 T2I 模型在 GenEval++ 和 T2I-CompBench 上的生成质量。代码已公开于 https://github.com/xiaomoguhz/R3-Bench。
引用
@article{arxiv.2605.19639,
title = {Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation},
author = {Junjie Wang and Xinghua Lou and Jason Li and Ye Tian and Keyu Chen and Yulin Li and Bin Kang and Jacky Mai and Yanwei Li and Zhuotao Tian and Liqiang Nie},
journal= {arXiv preprint arXiv:2605.19639},
year = {2026}
}