中文

基于人类反馈的分布鲁棒强化学习

机器学习 2025-03-04 v1 人工智能 计算与语言

摘要

从人类反馈获得的强化学习 (RLHF) 已成为微调大型语言模型 (LLM) 的主要方法之一。然而,现有的 RLHF 方法不够稳健,当下游任务与用于微调的偏好数据集有显著差异时,性能会恶化。为缓解这一问题,我们引入一种用于微调 LLM 的分布鲁棒 RLHF。具体而言,我们的目标是确保在提示词分布显著不同于微调期间所遇到的分布时,经过微调的模型仍能保持其性能。我们提出了两种流行微调方法的分布鲁棒优化 (DRO) 版本——(1)基于奖励的 RLHF 和 (2)基于奖励自由的 DPO (直接偏好优化)。我们提出了基于小批量梯度下降的两种算法,并理论上证明了算法的收敛性。随后,我们在不同的分布外部 (OOD) 任务上评估了这些算法,首先在统一反馈数据集上训练模型,再在两个不同的数据集上评估其性能。实验结果表明,我们的稳健训练在平均情况下提高了所学习奖励模型的准确率,在某些任务(如推理)上效果尤为显著。此外,我们还展示了稳健版本的策略优化方法同样能在 OOD 任务上提升性能。

关键词

引用

@article{arxiv.2503.00539,
  title  = {Distributionally Robust Reinforcement Learning with Human Feedback},
  author = {Debmalya Mandal and Paulius Sasnauskas and Goran Radanovic},
  journal= {arXiv preprint arXiv:2503.00539},
  year   = {2025}
}