中文

面向生成式推荐系统的鲁棒后训练:指数奖励加权 SFT 为何优于 RLHF

机器学习 2026-03-12 v1

摘要

通过后训练对生成式推荐系统进行用户偏好对齐,是关闭下一个项目预测与实际推荐质量之间差距的关键。现有后训练方法不适用于生产规模的系统:RLHF 方法因用户反馈噪声和不可靠的奖励模型而受奖励作弊影响,离线 RL 方法需要不可用的倾向性得分,而在线交互又不可行。我们识别出基于指数奖励加权 SFT(权重 w=exp(r/λ)w = \exp(r/\lambda))为唯一适合此场景的方法,并提供了解释其优势的理论与实证依据。通过直接优化观察到的奖励而无需查询学习奖励模型,该方法免受奖励作弊影响,无需倾向性得分,完全离线。我们证明了在噪声奖励条件下,首个策略改进保证,表明间隙仅随目录规模对数增长,且即使在大型物品目录下仍保持信息性。关键的是,我们展示温度 λ\lambda 明确且可量化地控制鲁棒性-改进之间的权衡,为实践者提供一个具有理论依据的单一可解释正则化超参数。针对四个基线,在三个开源数据集和一个专有数据集上的实验表明,指数奖励加权方法简单、可扩展且始终优于基于 RLHF 的替代方案。

关键词

引用

@article{arxiv.2603.10279,
  title  = {Robust Post-Training for Generative Recommenders: Why Exponential Reward-Weighted SFT Outperforms RLHF},
  author = {Keertana Chidambaram and Sanath Kumar Krishnamurthy and Qiuling Xu and Ko-Jen Hsiao and Moumita Bhattacharya},
  journal= {arXiv preprint arXiv:2603.10279},
  year   = {2026}
}