SALSA: 基于汤的对齐学习,用于强化学习人类反馈中的更强适应
机器学习
2024-11-05 v1
摘要
在大语言模型(LLM)开发中,强化学习人类反馈(RLHF)对于将模型与人类价值观和偏好对齐至关重要。RLHF 传统上依赖当前策略与冻结的初始策略之间的 Kullback-Leibler(KL)散度,并将其作为 Proximal Policy Optimization(PPO)等策略优化算法中的惩罚项。虽然该约束可防止模型偏离初始检查点太远,但它限制了奖励景观的探索,降低了模型发现更高质量解的能力。因此,策略优化常常被困在参数空间的狭窄区域,导致次优的对齐和性能。本文提出 SALSA(Soup-based Alignment Learning for Stronger Adaptation),一种通过两个独立监督微调(SFT)模型的权重空间平均来创建更灵活且定位更优的参考模型的新方法,以克服上述限制。这种模型汤允许 KL 散度有更大的偏离,在不牺牲稳定性的前提下探索解空间中有前景的区域。通过利用这一更鲁棒的参考模型,SALSA 促进了更好的探索,实现了更高的奖励,并改善了模型的鲁棒性、分布外泛化和性能。我们在 Llama2-7B、Mistral-7B 和 Gemma-2B 等流行开放模型以及 MT-Bench、Arena-Hard、UltraFeedback 等多个基准测试上进行了广泛实验验证,SALSA 一致地超越了 PPO,通过促进更深层次的探索实现了 LLM 中更优的对齐。
引用
@article{arxiv.2411.01798,
title = {SALSA: Soup-based Alignment Learning for Stronger Adaptation in RLHF},
author = {Atoosa Chegini and Hamid Kazemi and Iman Mirzadeh and Dong Yin and Maxwell Horton and Moin Nabi and Mehrdad Farajtabar and Keivan Alizadeh},
journal= {arXiv preprint arXiv:2411.01798},
year = {2024}
}