图像即其自身奖励:基于对抗奖励的强化学习图像生成
计算机视觉与模式识别
2025-11-26 v1
摘要
可靠的奖励函数是强化学习 (RL) 在图像生成中的关键。当前大多数 RL 方法依赖预训练的偏好模型,以输出标量奖励来近似人类偏好。然而,这些奖励常常无法捕捉人类感知,容易受到奖励攻击,即得分更高但图像质量更差。为此,我们引入 Adv-GRPO,一种包含对抗奖励的 RL 框架,迭代更新奖励模型和生成器。奖励模型使用参考图像作为正样本进行监督,可大幅避免被攻击。与约束参数更新的 KL 正则化不同,我们学习到的奖励直接通过视觉输出指导生成器,导致更高质量的图像。此外,虽然优化现有奖励函数可缓解奖励攻击,但其固有的偏见仍然存在。例如,PickScore 可能降低图像质量,而基于 OCR 的奖励常常降低审美保真度。为此,我们将图像本身作为奖励,使用参考图像和视觉基础模型(如 DINO)提供丰富的视觉奖励。这些稠密视觉信号而非单个标量,带来在图像质量、审美和任务特定指标上的一致性提升。最后,我们表明,将参考样本与基础模型奖励组合可实现分布迁移和灵活的风格定制。在人类评估中,我们的方法在图像质量和审美方面分别超过 Flow-GRPO 和 SD3,分别以 70.0% 和 72.4% 的胜率获胜。代码和模型已公开发布。
引用
@article{arxiv.2511.20256,
title = {The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation},
author = {Weijia Mao and Hao Chen and Zhenheng Yang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2511.20256},
year = {2025}
}