中文

基于隐式语言 Q 学习的自然语言生成离线强化学习

计算与语言 2023-05-02 v2 机器学习

摘要

大语言模型从文本语料库中提炼广泛知识。然而,在完成为用户指定的任务时,它们可能不一致。该问题可通过在精选数据集上通过监督学习微调此类模型,或通过强化学习来解决。在这项工作中,我们提出了一种新颖的离线 RL 方法,隐式语言 Q 学习(ILQL),专为语言模型设计,它结合了 RL 算法灵活的效用最大化框架与监督学习利用已收集数据的能力,以及其简单性和稳定性。我们的方法在价值函数学习中采用了价值保守性与隐式数据集支持约束相结合,然后用于引导语言模型生成以最大化用户指定的效用函数。除了实证验证 ILQL 外,我们还对离线 RL 在自然语言生成设置中可能有用的情形进行了详细实证分析,展示了它如何成为比先前方法更有效的端到端对话效用优化器,以及它如何基于主观判断(例如是否将评论标记为有毒)有效优化高方差奖励函数。

关键词

引用

@article{arxiv.2206.11871,
  title  = {Offline RL for Natural Language Generation with Implicit Language Q Learning},
  author = {Charlie Snell and Ilya Kostrikov and Yi Su and Mengjiao Yang and Sergey Levine},
  journal= {arXiv preprint arXiv:2206.11871},
  year   = {2023}
}