中文

基于演示引导的强化学习抵消大语言模型中的奖励过优化

计算与语言 2024-05-01 v1

摘要

尽管强化学习(RL)已被证明对于调优大语言模型(LLMs)至关重要,但它可能导致奖励过优化(ROO)。现有方法通过添加KL正则化来解决ROO问题,这需要进行计算昂贵的超参数调优。此外,KL正则化仅关注对语言策略进行正则化,忽略了奖励函数本身可能作为正则化来源。灵感来自演示引导的强化学习,我们在此引入了从演示校准奖励(Reward Calibration from Demonstration, RCfD)方法,该方法利用人类演示和奖励模型来重新校准奖励目标。形式地说,给定提示后,RCfD目标最小化演示奖励与LLM奖励之间的距离,而非直接最大化奖励函数。这种目标转变避免了LLM利用奖励模型的激励,促进了更自然且多样的语言生成。我们在三个语言任务上展示了RCfD的有效性,实现了与经过精心调谋的基线相当的性能,同时缓解了ROO问题。

关键词

引用

@article{arxiv.2404.19409,
  title  = {Countering Reward Over-optimization in LLM with Demonstration-Guided Reinforcement Learning},
  author = {Mathieu Rita and Florian Strub and Rahma Chaabouni and Paul Michel and Emmanuel Dupoux and Olivier Pietquin},
  journal= {arXiv preprint arXiv:2404.19409},
  year   = {2024}
}