基于生成对抗奖励建模的语言模型微调
计算与语言
2024-03-06 v3 人工智能
机器学习
摘要
基于人类反馈的强化学习(RLHF)已被证明能通过指令微调将大语言模型(LLMs)的输出与期望的人类价值对齐,从而显著提升其性能。然而,RLHF 受限于人类评估者的专业能力与效率。对此的一种应对方式是退而采用有额外精心挑选的专家示范的监督微调(SFT)。尽管该方法已被证明有效,但它不可避免地也会导致人类在环开销的增加。在本研究中,我们提出另一种替代方法:相对于 RLHF 与 SFT 的基于生成对抗反馈的强化学习(RLGAF),其采用生成对抗训练风格,使 LLMs 能够学习有用的人类专家示范而无需直接暴露于训练样本,从而在保持样本效率的同时具备良好的泛化能力。我们的初步结果表明,RLGAF 可帮助对齐 LLMs 输出,取得与 RLHF 和 SFT 相竞争的绩效,且不受它们各自固有局限的困扰,这为自动化 AI 对齐的进一步研究指明了有前景的途径。
引用
@article{arxiv.2305.06176,
title = {Fine-tuning Language Models with Generative Adversarial Reward Modelling},
author = {Zhang Ze Yu and Lau Jia Jaw and Zhang Hui and Bryan Kian Hsiang Low},
journal= {arXiv preprint arXiv:2305.06176},
year = {2024}
}
备注
22 pages, 9 figures, 12 tables