教模型提高性能
计算与语言
2024-11-07 v3
摘要
大型语言模型(LLM)在被要求在特定约束下生成内容时常常表现不佳。然而,在此类情况下,检查这些约束是否被满足或被违反往往很容易。最近的研究表明,LLM 可以从此类“纠错反馈”中获益。我们主张通过训练可以显著增强 LLM 掌握此类技能的能力。我们引入一种强化学习框架,通过模拟交互会话并根据模型满足约束的能力对其进行奖励来教导模型使用此类奖励。我们将该方法称为 CORGI(Controlled Generation with RL for Guided Interaction),并使用无标签训练数据在各种受控生成任务上对其进行评估。我们发现 CORGI 在不包含对话反馈的基线强化学习方法之上 consistently 优于后者。此外,CORGI 的交互框架使 LLM 能够通过 meta-learning 更好地泛化到新的任务中的 guided interaction。我们的结果清晰地表明,对话优化当与强化学习结合时,显著提高了 LLM 在受控生成情境中的效果。
引用
@article{arxiv.2411.01483,
title = {Teaching Models to Improve on Tape},
author = {Liat Bezalel and Eyal Orgad and Amir Globerson},
journal= {arXiv preprint arXiv:2411.01483},
year = {2024}
}