中文

用于语言建模的强化自训练(ReST)

计算与语言 2023-08-22 v2 机器学习

摘要

基于人类反馈的强化学习(RLHF)能够通过使大语言模型(LLM)的输出与人类偏好对齐来提升其质量。我们受增长式批量强化学习(RL)启发,提出了一种简单的、使 LLM 与人类偏好对齐的算法,称之为强化自训练(ReST)。给定一个初始 LLM 策略,ReST 通过从该策略中采样生成数据集,随后使用离线 RL 算法来改进 LLM 策略。ReST 比典型的在线 RLHF 方法更高效,因为训练数据集是离线生成的,这允许数据重用。虽然 ReST 是一种适用于所有生成式学习设置的通用方法,我们聚焦于其在机器翻译上的应用。我们的结果表明,ReST 能够以计算和样本高效的方式,在机器翻译基准上通过自动化指标和人类评估大幅改善翻译质量。

关键词

引用

@article{arxiv.2308.08998,
  title  = {Reinforced Self-Training (ReST) for Language Modeling},
  author = {Caglar Gulcehre and Tom Le Paine and Srivatsan Srinivasan and Ksenia Konyushkova and Lotte Weerts and Abhishek Sharma and Aditya Siddhant and Alex Ahern and Miaosen Wang and Chenjie Gu and Wolfgang Macherey and Arnaud Doucet and Orhan Firat and Nando de Freitas},
  journal= {arXiv preprint arXiv:2308.08998},
  year   = {2023}
}

备注

23 pages, 16 figures