中文

ReDit:基于奖励抖动改进的LLM策略优化

机器学习 2025-10-27 v4 人工智能 计算与语言

摘要

DeepSeek-R1通过基于规则的奖励系统成功提升了大型语言模型(LLM)的推理能力。虽然这是一套“完美”的奖励系统,有效缓解了奖励操纵问题,但此类奖励函数往往是离散的。我们的实验观察表明,离散奖励可能导致梯度异常、优化不稳定和收敛缓慢。为此,我们提出了ReDit(Reward Dithering),即通过添加简单随机噪声来抖动离散奖励信号。借助该扰动奖励,可在整个学习过程中持续提供探索性梯度,从而实现更平滑的梯度更新并加快收敛。注入的噪声还为平坦奖励区域引入随机性,鼓励模型探索新策略并跳出局部最优。跨多个任务的实验表明,ReDit的有效性和效率令人满意。在平均情况下,ReDit仅需约10%的训练步数即可达到vanilla GRPO的性能水平,并且在相同训练时长下,仍比vanilla GRPO高出4%的性能提升。可视化结果确认了ReDit显著缓解了梯度问题。此外,还提供了理论分析进一步验证这些优势。

关键词

引用

@article{arxiv.2506.18631,
  title  = {ReDit: Reward Dithering for Improved LLM Policy Optimization},
  author = {Chenxing Wei and Jiarui Yu and Ying Tiffany He and Hande Dong and Yao Shu and Fei Yu},
  journal= {arXiv preprint arXiv:2506.18631},
  year   = {2025}
}

备注

34 pages, 19 figures