中文

通过合成反馈对齐大语言模型

计算与语言 2023-10-24 v2 人工智能 机器学习

摘要

将大语言模型(LLMs)对齐到人类价值观已变得愈发重要,因为它能够实现对 LLMs 的精细引导。然而,这通常需要大量人类示范与反馈,或来自 ChatGPT 等专有 LLMs 的蒸馏。在本工作中,我们提出了一种不依赖于大量人类标注和专有 LLMs 的、基于合成反馈的新型对齐学习框架。首先,我们通过将不同规模和提示下的原始 LLMs 的响应进行对比来进行合成反馈的奖励建模(RM)。然后,我们利用该 RM 模拟高质量示范以训练监督策略,并通过强化学习进一步优化模型。我们最终得到的模型,即基于合成训练数据集的对齐语言模型(ALMoST),在对齐基准上优于近期基于 InstructGPT 输出或人类标注示范训练的开源模型。在人类评估中,我们的模型分别有 55.0% 和 58.5% 的概率被偏好于 Alpaca 和 Dolly-v2。进一步的分析证明了合成反馈在我们框架中的有效性与重要性。代码已发布于 https://github.com/naver-ai/almost

关键词

引用

@article{arxiv.2305.13735,
  title  = {Aligning Large Language Models through Synthetic Feedback},
  author = {Sungdong Kim and Sanghwan Bae and Jamin Shin and Soyoung Kang and Donghyun Kwak and Kang Min Yoo and Minjoon Seo},
  journal= {arXiv preprint arXiv:2305.13735},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 main conference