事后回顾链使语言模型与反馈对齐
机器学习
2023-10-19 v8 计算与语言
摘要
从人类偏好中学习对于语言模型匹配人类需求并与人类及社会价值观对齐至关重要。先前的工作通过从人类反馈中学习以理解和遵循指令,取得了显著成功。然而,这些方法要么建立在受人类标注者青睐的精选模型生成之上,导致其数据利用效率低下且难以普遍应用;要么依赖于强化学习,而这常常受到不完美奖励函数的困扰,并依赖于极具挑战性的优化。在这项工作中,我们提出了一种新颖的技术——事后回顾链,它易于优化,并且能够从任何形式的反馈中学习,无论其极性如何。我们的想法受到人类如何从以语言形式呈现的大量反馈中学习的启发。我们将所有类型的反馈转换为句子序列,随后用于微调模型,这使我们能够利用语言模型的语言理解能力。我们以与反馈配对的模型生成序列为条件来训练模型。通过这样做,模型被训练为基于反馈生成输出,同时学习识别和纠正负面属性或错误。将我们的方法应用于大型语言模型,我们观察到事后回顾链在使语言模型与人类偏好对齐方面显著超越了先前的方法。我们报告了在摘要和对话基准上的显著改进,并且在人类评估中我们的方法受到了明显的偏好。
引用
@article{arxiv.2302.02676,
title = {Chain of Hindsight Aligns Language Models with Feedback},
author = {Hao Liu and Carmelo Sferrazza and Pieter Abbeel},
journal= {arXiv preprint arXiv:2302.02676},
year = {2023}
}