RationalRewards:推理奖励同时提升视觉生成的训练与测试
人工智能
2026-04-15 v2 机器学习
摘要
大多数视觉生成奖励模型将丰富的人类判断简化为单一未解释的分数,丢弃了其背后推理过程。我们展示,教授奖励模型生成明确、多维度的批判性评估再给分数,这会将其从被动评估者转化为主动优化工具,从两个互补方式提升生成器性能:在训练时,结构化理由为强化学习提供可解释、细粒度的奖励;在测试时,生成-批判-精炼循环将批判转化为针对性的提示修订,在不进行任何参数更新的情况下提升输出效果。为了在不昂贵理由标注的情况下训练此类奖励模型,我们提出偏好锚定理化 (PARROT),这是一种从可获得的偏好数据通过锚定生成、一致性过滤和蒸馏恢复高质量理由的原则框架。 resulting model,RationalRewards (8B),在开源奖励模型中实现首屈比一的偏好预测能力,与 Gemini-2.5-Pro 相当,却使用的训练数据仅为类似基线的 10-20 倍。作为 RL 奖励,它持续改进文本到图像和图像编辑生成器,超越标量方案。最令人瞩目的的是,其测试时批判与精炼循环在多个基准上匹配或超越 RL 微调,表明结构化推理可以解锁现有生成器中被次优提示所未激发的潜在能力。
引用
@article{arxiv.2604.11626,
title = {RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time},
author = {Haozhe Wang and Cong Wei and Weiming Ren and Jiaming Liu and Fangzhen Lin and Wenhu Chen},
journal= {arXiv preprint arXiv:2604.11626},
year = {2026}
}
备注
Project Page: https://tiger-ai-lab.github.io/RationalRewards/ ; Code, Dataset, Models are released