中文

从SFT数据中榨取更多价值:从人类演示中学习奖励改进了LLM对齐的SFT

人工智能 2024-10-29 v3

摘要

对齐人类偏好和价值观是当代基础模型的一个重要要求。最先进的技术,如基于人类反馈的强化学习(RLHF),通常包括两个阶段:1)监督微调(SFT),其中模型通过从人类演示数据中学习进行微调;2)偏好学习,其中偏好数据用于学习奖励模型,该奖励模型随后被强化学习(RL)步骤用于微调模型。这样的奖励模型充当人类偏好的代理,对于引导RL步骤提高模型质量至关重要。在这项工作中,我们认为SFT阶段也显著受益于学习奖励模型。我们建议利用逆强化学习(IRL)技术同时构建奖励模型和策略模型,而不是通过监督学习直接使用人类演示数据。这种方法产生了新的SFT算法,这些算法不仅实现高效,而且对低质量监督学习数据的存在具有鲁棒性。此外,我们发现了所提出的基于IRL的方法与最近一系列称为Self-Play Fine-tune(SPIN)的工作之间的联系。理论上,我们证明了所提出的算法收敛到IRL问题的平稳解。实验上,我们使用所提出的方法对齐了1B和7B模型,并在奖励基准模型和HuggingFace Open LLM排行榜上对其进行了评估。所提出的方法在性能上显著优于现有的SFT方法。我们的结果表明,在整个对齐过程中利用奖励学习是有益的。

关键词

引用

@article{arxiv.2405.17888,
  title  = {Getting More Juice Out of the SFT Data: Reward Learning from Human Demonstration Improves SFT for LLM Alignment},
  author = {Jiaxiang Li and Siliang Zeng and Hoi-To Wai and Chenliang Li and Alfredo Garcia and Mingyi Hong},
  journal= {arXiv preprint arXiv:2405.17888},
  year   = {2024}
}