直接纳什优化:利用一般偏好教会语言模型自我改进
机器学习
2024-04-08 v1 人工智能
计算与语言
摘要
本文研究使用强大预言机的偏好反馈对大型语言模型进行后训练,以帮助模型迭代地自我改进。后训练大型语言模型的典型方法涉及基于人类反馈的强化学习,传统上分离奖励学习和后续策略优化。然而,这种奖励最大化方法受限于“点式”奖励(如Bradley-Terry模型)的性质,无法表达复杂的非传递或循环偏好关系。尽管强化学习人类反馈的进展表明奖励学习和策略优化可以合并为一个单一的对比目标以保持稳定性,但它们仍然受限于奖励最大化框架。最近,新一轮研究绕过了奖励最大化的假设,转而直接优化“成对”或一般偏好。在本文中,我们引入了直接纳什优化,一种可证明且可扩展的算法,它将对比学习的简单性和稳定性与优化一般偏好的理论通用性相结合。由于直接纳什优化是一种使用基于回归目标的批量在策略算法,其实现简单且高效。此外,直接纳什优化在迭代中享有单调改进,这有助于其甚至超越强大的教师模型(如GPT-4)。在我们的实验中,通过直接纳什优化对齐的7B参数Orca-2.5模型在AlpacaEval 2.0上对GPT-4-Turbo达到了33%的最先进胜率(即使在控制响应长度后),比初始模型绝对提升了26%(从7%到33%)。它超越了参数多得多的模型,包括Mistral Large、Self-Rewarding LM(70B参数)和旧版GPT-4。
引用
@article{arxiv.2404.03715,
title = {Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences},
author = {Corby Rosset and Ching-An Cheng and Arindam Mitra and Michael Santacroce and Ahmed Awadallah and Tengyang Xie},
journal= {arXiv preprint arXiv:2404.03715},
year = {2024}
}