理解 RLHF 对大语言模型泛化与多样性的影响
机器学习
2024-02-20 v3 人工智能
计算与语言
摘要
使用基于人类反馈的强化学习(RLHF)微调的大语言模型(LLMs)已被用于迄今一些最广泛部署的 AI 模型中,如 OpenAI 的 ChatGPT 或 Anthropic 的 Claude。尽管开发这些方法已有大量工作,我们对 RLHF 各阶段的利弊仍理解有限。为填补此空白,我们广泛分析了该过程各阶段(即监督微调(SFT)、奖励建模和 RLHF)如何影响两个关键属性:分布外(OOD)泛化和输出多样性。鉴于这些模型被使用的广泛真实场景,OOD 泛化至关重要;而输出多样性指模型生成多样化输出的能力,对多种用例十分重要。我们在两个基模型上针对摘要和指令跟随任务(后者与当前 LLM 用例高度相关)进行分析。我们发现 RLHF 比 SFT 对新输入泛化更好,尤其在训练与测试间分布偏移更大时。然而,相较 SFT,RLHF 在各种度量下显著降低了输出多样性,意味着当前 LLM 微调方法在泛化与多样性间存在权衡。我们的结果为依据应用选择微调方法提供指导,并表明需要更多研究以改进泛化与多样性间的权衡。
引用
@article{arxiv.2310.06452,
title = {Understanding the Effects of RLHF on LLM Generalisation and Diversity},
author = {Robert Kirk and Ishita Mediratta and Christoforos Nalmpantis and Jelena Luketina and Eric Hambro and Edward Grefenstette and Roberta Raileanu},
journal= {arXiv preprint arXiv:2310.06452},
year = {2024}
}
备注
Code available here: https://github.com/facebookresearch/rlfh-gen-div