RL4F:利用强化学习生成自然语言反馈以修复模型输出
计算与语言
2023-07-13 v2
摘要
尽管取得了前所未有的成功,即使最大的语言模型也会犯错。类似于人类利用反馈学习和改进,先前工作提出为语言模型提供自然语言反馈以引导其修复输出。由于人工生成的批评代价高昂,研究者设计了习得的批评生成器来替代人类批评者,同时假设可以训练下游模型以利用生成的反馈。然而,这种方法不适用于 ChatGPT 等黑盒或受限访问模型,因为它们无法被微调。此外,在大型通用语言智能体时代,微调在计算和空间上均不高效,因为它会导致网络的多个副本。在本工作中,我们引入 RL4F(Reinforcement Learning for Feedback,用于反馈的强化学习),这是一个多智能体协作框架,其中批评生成器被训练以最大化 GPT-3(一个规模超过其 200 倍的固定模型)的端任务性能。RL4F 生成的批评有助于 GPT-3 修订其输出。我们研究了三个用于动作规划、摘要和字母排序的数据集,并展示了在多个文本相似度指标上相对于其他习得的、检索增强的或基于提示的批评生成器最高达 10% 的相对提升。
引用
@article{arxiv.2305.08844,
title = {RL4F: Generating Natural Language Feedback with Reinforcement Learning for Repairing Model Outputs},
author = {Afra Feyza Akyürek and Ekin Akyürek and Aman Madaan and Ashwin Kalyan and Peter Clark and Derry Wijaya and Niket Tandon},
journal= {arXiv preprint arXiv:2305.08844},
year = {2023}
}
备注
ACL 2023