中文

从人类反馈中学习摘要

计算与语言 2022-02-17 v3 人工智能 机器学习

摘要

随着语言模型变得更加强大,训练和评估越来越受到特定任务所用数据和指标的瓶颈限制。例如,摘要模型通常被训练来预测人类参考摘要,并使用 ROUGE 进行评估,但这两种指标都是我们所真正关心的——摘要质量——的粗略代理。在这项工作中,我们表明,通过训练一个模型来优化人类偏好,可以显著提升摘要质量。我们收集了一个大规模、高质量的人类摘要对比数据集,训练一个模型来预测人类偏好的摘要,并将该模型作为奖励函数,使用强化学习来微调摘要策略。我们将我们的方法应用于 Reddit 帖子的 TL;DR 数据集的一个版本,发现我们的模型显著优于人类参考摘要以及仅使用监督学习微调的更大得多的模型。我们的模型还能迁移到 CNN/DM 新闻文章,无需任何新闻特定的微调即可生成几乎与人类参考一样好的摘要。我们进行了广泛的分析以理解我们的人类反馈数据集和微调模型。我们确认我们的奖励模型能泛化到新数据集,并且根据人类判断,优化我们的奖励模型比优化 ROUGE 能得到更好的摘要。我们希望本文的证据能促使机器学习研究者更密切地关注其训练损失如何影响他们真正想要的模型行为。

关键词

引用

@article{arxiv.2009.01325,
  title  = {Learning to summarize from human feedback},
  author = {Nisan Stiennon and Long Ouyang and Jeff Wu and Daniel M. Ziegler and Ryan Lowe and Chelsea Voss and Alec Radford and Dario Amodei and Paul Christiano},
  journal= {arXiv preprint arXiv:2009.01325},
  year   = {2022}
}

备注

NeurIPS 2020