中文

通过在线策略自判断对齐大语言模型

机器学习 2024-06-26 v3 人工智能 计算与语言

摘要

现有将大语言模型与人类偏好对齐的方法面临一种权衡,即需要单独的奖励模型 (RM) 来进行在线策略学习。在本文中,我们提出了一种新颖的对齐框架 SELF-JUDGE,它 (1) 进行在线策略学习,且 (2) 参数高效,因为它不需要额外的 RM 来评估在线策略学习的样本。为此,我们提出了法官增强的监督微调 (JSFT) 来训练单个模型同时充当策略和法官。具体而言,我们将成对判断任务(从一对响应中选择更好的响应)视为指令跟随任务的一个特例。生成的模型可以判断由当前策略(其自身初始化)即时生成的响应的偏好。实验结果显示了 SELF-JUDGE 的有效性,其在偏好基准测试中优于基线。我们还表明,仅通过拒绝采样即可在没有额外评估器的情况下进一步提升性能。

关键词

引用

@article{arxiv.2402.11253,
  title  = {Aligning Large Language Models by On-Policy Self-Judgment},
  author = {Sangkyu Lee and Sungdong Kim and Ashkan Yousefpour and Minjoon Seo and Kang Min Yoo and Youngjae Yu},
  journal= {arXiv preprint arXiv:2402.11253},
  year   = {2024}
}

备注

Published as a main conference paper at ACL 2024