中文

面向多任务与模型规模的对称强化学习损失

机器学习 2025-06-24 v3 人工智能

摘要

强化学习(RL)训练本质上不稳定,受诸多因素影响,如移动目标和高梯度方差。从人类反馈进行强化学习(RLHF)和从AI反馈进行强化学习(RLAIF)会引入额外的难度。不同偏好可能会复杂化对齐过程,而训练奖励模型中的预测误差在LLM生成未见输出时会更加严重。为增强训练鲁棒性,RL已采用监督学习中的某些技术,如集成和层归一化。本文通过将监督学习中用于噪声数据的逆交叉熵(RCE)应用于RL,定义一种对称RL损失,以提高训练稳定性。我们在各种任务和规模上 demonstrate了性能提升。我们在离散动作任务(Atari游戏)和连续动作空间任务(MuJoCo基准和Box2D)中使用对称A2C(SA2C)和对称PPO(SPPO),并在不同超参数下尤其在SPPO中取得显著成果。此外,我们验证了在大规模语言模型中使用对称RL损失的益处,通过在RLHF任务中实现性能提升,如IMDB积极情感分析和TL;DR摘要任务。

关键词

引用

@article{arxiv.2405.17618,
  title  = {Symmetric Reinforcement Learning Loss for Robust Learning on Diverse Tasks and Model Scales},
  author = {Ju-Seung Byun and Andrew Perrault},
  journal= {arXiv preprint arXiv:2405.17618},
  year   = {2025}
}