中文

强化学习(不)适用于自然语言处理吗:面向自然语言策略优化的基准、基线与构建模块

计算与语言 2023-12-05 v3 机器学习

摘要

我们解决将预训练大型语言模型(LMs)与人类偏好对齐的问题。若将文本生成视为序贯决策问题,强化学习(RL)看似天然的概念框架。然而,将 RL 用于基于 LM 的生成面临经验挑战,包括因组合动作空间导致的训练不稳定性,以及缺乏为 LM 对齐定制的开源库与基准。因此,研究界浮现一个问题:RL 是否是 NLP 的实用范式?为助回答此问,我们首先引入开源模块化库 RL4LMs(Reinforcement Learning for Language Models),用于以 RL 优化语言生成器。该库包含策略内 RL 算法,可用于训练 HuggingFace 库(Wolf 等,2020)中任意编码器或编码器-解码器 LM,配以任意奖励函数。接下来,我们提出 GRUE(General Reinforced-language Understanding Evaluation)基准,一组 6 项语言生成任务,其监督不来自目标字符串,而来自捕捉人类偏好自动化度量的奖励函数。GRUE 是首个针对 NLP 任务的 RL 算法排行榜式评估。最后,我们引入易用且高性能的 RL 算法 NLPO(Natural Language Policy Optimization),可学习有效缩减语言生成中的组合动作空间。我们表明:1)相较监督方法,RL 技术通常更优地将 LMs 对齐至人类偏好;2)基于自动与人工评估,NLPO 比先前策略梯度方法(如 PPO(Schulman 等,2017))展现更强稳定性与性能。

关键词

引用

@article{arxiv.2210.01241,
  title  = {Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization},
  author = {Rajkumar Ramamurthy and Prithviraj Ammanabrolu and Kianté Brantley and Jack Hessel and Rafet Sifa and Christian Bauckhage and Hannaneh Hajishirzi and Yejin Choi},
  journal= {arXiv preprint arXiv:2210.01241},
  year   = {2023}
}

备注

In Proceedings of ICLR 2023. Code found at https://github.com/allenai/rl4lms and Project website at https://rl4lms.apps.allenai.org/