基于超线性优势塑形的文本到图像模型幂 reinforcement 后训练
计算机视觉与模式识别
2026-05-12 v1
摘要
最近,基于强化学习的后训练方法,特别是聚类相对策略优化 (GRPO),已成为文本到图像 (T2I) 模型进一步提升的稳健范式。然而,这些方法常常容易出现奖励攻击,即模型利用不完美奖励函数中的偏差,而非产生真实的性能提升。本文我们识别到规范化可能导致失配,直接删除提示级别的标准差项可得到线性优势但仍限制真实信号与噪声的分离。为缓解上述问题,我们提出超线性优势塑形 (SLAS),通过从信息几何视角重新审视功能更新。通过在费舍尔-罗信息度量上引入基于优势的加权,SLAS引入非线性几何结构,以重新塑形局部策略空间。该设计沿着高优势方向放宽约束以放大有信息的更新,同时在低优势区域紧缩以抑制虚幻梯度。此外,应用批量级规范化以稳定不同奖励尺度下的训练。广泛的评估表明,SLAS在多个网络架构和基准上 consistently 超过DanceGRPO基线。特别是,它实现更快的训练动力学,在GenEval和UniGenBench++上的外域性能提升,以及对模型规模的鲁棒性增强,同时缓解奖励攻击,保持生成的语义和组合保真。
引用
@article{arxiv.2605.10937,
title = {Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping},
author = {Haoyuan Sun and Jing Wang and Yuxin Song and Yu Lu and Bo Fang and Yifu Luo and Jun Yin and Pengyu Zeng and Miao Zhang and Tiantian Zhang and Xueqian Wang and Shijian Lu},
journal= {arXiv preprint arXiv:2605.10937},
year = {2026}
}