Curriculum-RLAIF:基于 AI 反馈强化学习的课程对齐
人工智能
2026-04-21 v2
摘要
通过 AI 反馈强化学习(RLAIF)方法训练的奖励模型经常受限于泛化能力有限,这阻碍了策略模型的对齐性能。这一挑战源于多种问题,包括分布偏移、偏好标签噪声以及过度困难的样本与模型容量不匹配。在本文中,我们旨在通过以数据为中心的方法来增强奖励模型的泛化能力,其动机源于从数据难度的统一视角来看这些问题是内在交织的见解。因此,我们提出了一个新颖的框架 Curriculum-RLAIF,它构建了具有不同难度级别的偏好对,随后为奖励模型训练生成特定的课程。综合实验结果表明,使用 Curriculum-RLAIF 训练的奖励模型实现了更好的泛化能力,与各种现有的非课程基线相比,在不产生额外推理成本的情况下大幅提升了策略模型的对齐性能。进一步的分析和与替代策略的比较突显了 Curriculum-RLAIF 在简单性、效率和有效性方面的优越性。
引用
@article{arxiv.2505.20075,
title = {Curriculum-RLAIF: Curriculum Alignment with Reinforcement Learning from AI Feedback},
author = {Jiaye Lin and Mengdi Li and Xufeng Zhao and Wenhao Lu and Peilin Zhao and Stefan Wermter and Di Wang},
journal= {arXiv preprint arXiv:2505.20075},
year = {2026}
}