中文

Reward-Instruct:一种以奖励为中心的快速逼真图像生成方法

计算机视觉与模式识别 2025-06-10 v2

摘要

本文探讨了实现符合复杂人类偏好的高质量、快速图像生成所面临的挑战。尽管扩散模型和蒸馏领域的最新进展实现了快速生成,但如何有效整合奖励反馈以提升可控性和偏好对齐等能力,仍是一个关键的开放性问题。针对加速少步生成的现有奖励引导后训练方法通常认为扩散蒸馏损失是不可或缺的。然而在本文中,我们发现了一个有趣且根本性的范式转变:随着条件变得更加具体,设计良好的奖励函数成为训练强大的少步图像生成模型的主要驱动力。受此启发,我们引入了 Reward-Instruct,一种新颖且出奇简单的以奖励为中心的方法,用于将预训练的基础扩散模型转换为奖励增强的少步生成器。与现有方法不同,Reward-Instruct 不依赖昂贵且棘手的扩散蒸馏损失。相反,它通过直接从奖励倾斜的参数分布中采样,迭代地更新少步生成器的参数。这种训练方法完全绕过了对昂贵扩散蒸馏损失的需求,使其有利于向高图像分辨率扩展。尽管简单,Reward-Instruct 却产生了惊人的强大性能。我们在文本到图像生成上的大量实验表明,与依赖蒸馏的方法相比,Reward-Instruct 在视觉质量和定量指标上均取得了 SOTA 结果,同时对奖励函数的选择表现出更强的鲁棒性。

关键词

引用

@article{arxiv.2503.13070,
  title  = {Reward-Instruct: A Reward-Centric Approach to Fast Photo-Realistic Image Generation},
  author = {Yihong Luo and Tianyang Hu and Weijian Luo and Kenji Kawaguchi and Jing Tang},
  journal= {arXiv preprint arXiv:2503.13070},
  year   = {2025}
}