中文

从竞争到协同:解锁主导式图像生成的强化学习

机器学习 2026-04-23 v2 计算机视觉与模式识别 图形学

摘要

主导式图像生成模型面临身份保持 (保真度) 与提示遵循 (可编辑性) 之间的根本性权衡。虽然在线强化学习 (RL),特别是 GPRO 方法,提供了可行的解决方案,但我们发现,简单地应用 GRPO 会导致性能竞争性退化,因为对奖励进行静态权重的线性聚合会产生冲突的梯度信号,并与扩散过程的时间动力学产生错位。为克服这些限制,我们提出了 Customized-GRPO 框架,包含两个关键创新:(i) 协同感知奖励塑形 (SARS),一种非线性机制,显式惩罚冲突的奖励信号并放大协同一致的信号,提供更清晰果断的梯度。(ii) 时间感知动态加权 (TDW),通过在早期优先遵循提示、晚期优先保持身份来将优化压力与模型的时间动力学相匹配。大量实验表明,我们的方法显著优于简单 GRPO 的基线,成功缓解了竞争性退化。我们的模型实现了卓越的平衡,生成既保留关键身份特征又准确遵循复杂文本提示的图像。

关键词

引用

@article{arxiv.2510.18263,
  title  = {From Competition to Synergy: Unlocking Reinforcement Learning for Subject-Driven Image Generation},
  author = {Ziwei Huang and Ying Shu and Hao Fang and Quanyu Long and Wenya Wang and Qiushi Guo and Tiezheng Ge and Leilei Gan},
  journal= {arXiv preprint arXiv:2510.18263},
  year   = {2026}
}