利用人类反馈递归式总结书籍
计算与语言
2021-09-29 v2 人工智能
机器学习
摘要
扩展机器学习的一大挑战在于训练模型执行那些对人类而言极难或极耗时评估的任务。我们在整本虚构小说的抽取式摘要任务上报告了此问题的进展。我们的方法将人类反馈学习与递归任务分解相结合:我们使用在任务较小部分上训练的模型来辅助人类对更宽泛任务给出反馈。我们收集了大量来自人类标注者的示范与比较数据,并采用行为克隆与奖励建模对 GPT-3 进行微调,以递归方式进行摘要。在推理时,模型首先总结书籍的小节,然后递归地总结这些摘要以生成整本书的摘要。尽管人类标注者自身并未通读全书,他们仍能快速监督并评估模型。我们最终的模型能生成合理的整书摘要,在少数情况下(约 5% 的书籍)甚至匹配人类撰写摘要的质量。我们在近期 BookSum 数据集上取得了书级摘要的 SOTA 结果。使用这些摘要的零样本问答模型在具有挑战性的 NarrativeQA 基准(针对书籍与电影剧本提问)上取得了 SOTA 结果。我们发布了来自模型的样本数据集。
引用
@article{arxiv.2109.10862,
title = {Recursively Summarizing Books with Human Feedback},
author = {Jeff Wu and Long Ouyang and Daniel M. Ziegler and Nisan Stiennon and Ryan Lowe and Jan Leike and Paul Christiano},
journal= {arXiv preprint arXiv:2109.10862},
year = {2021}
}