Safe RLHF:基于人类反馈的安全强化学习
人工智能
2023-10-20 v1 机器学习
摘要
随着大语言模型(LLM)的发展,在 AI 系统的性能与安全之间取得平衡从未如此关键。然而,有用性与无害性目标之间的固有张力在 LLM 训练期间呈现出重大挑战。为解决此问题,我们提出 Safe RLHF(Safe Reinforcement Learning from Human Feedback,基于人类反馈的安全强化学习),一种用于人类价值对齐的新算法。Safe RLHF 显式解耦人类关于有用性与无害性的偏好,有效避免了众包标注员对该张力的困惑,并允许我们训练分离的奖励与代价模型。我们将 LLM 的安全关切形式化为一个在满足指定代价约束下最大化奖励函数的优化任务。利用拉格朗日方法求解该约束问题,Safe RLHF 在微调期间动态调整两个目标间的平衡。通过采用 Safe RLHF 的三轮微调,我们展现出相比现有价值对齐算法更优的减轻有害响应同时增强模型性能的能力。在实验上,我们使用 Safe RLHF 微调了 Alpaca-7B 并使其与收集的人类偏好对齐,根据人类评估显著提升了其有用性与无害性。
引用
@article{arxiv.2310.12773,
title = {Safe RLHF: Safe Reinforcement Learning from Human Feedback},
author = {Josef Dai and Xuehai Pan and Ruiyang Sun and Jiaming Ji and Xinbo Xu and Mickel Liu and Yizhou Wang and Yaodong Yang},
journal= {arXiv preprint arXiv:2310.12773},
year = {2023}
}