中文

通过系统消息泛化对齐大量偏好

计算与语言 2024-11-06 v2

摘要

尽管人类天生具有多样化的价值观,但当前的大语言模型(LLM)对齐方法往往假设以对一般公众偏好的最佳方式进行对齐。采用更个性化的方法进行LLM对齐面临一个主要挑战,即缺乏可扩展性,因为这需要为每个人的偏好反复获取偏好数据并训练新的奖励模型和LLM。为此,我们提出了一种新范式,即用户在系统消息中指定其最看重的价值,从而引导LLM的生成行为以更好地符合用户的意图。然而,由于LLM通常在统一的系统消息(例如"你是一个有帮助的助手")上进行训练,限制了其对多样化、未见的系统消息的泛化能力。为提高这种泛化能力,我们创建了“多维收集”数据集,包含19.2万种价值观的组合,超越通用的有帮助性与无害性,涵盖6.5万条用户指令。使用该数据集,我们训练了一个7B参数的LLM,命名为Janus,并在5个基准测试(AlpacaEval 2.0、FLASK、Koala、MT-Bench和Self-Instruct)中测试了通过添加各种未见系统消息来反映用户偏好的情境。Janus在对抗Mistral 7B Instruct v0.2、GPT-3.5 Turbo和GPT-4时分别实现了75.2%、72.4%和66.4%的平局+胜率。意外的是,在三个侧重响应有帮助性的基准测试(AlpacaEval 2.0、MT-Bench、Arena Hard Auto v0.1)上,Janus相较于LLaMA 3 8B Instruct分别提高了+4.0%、+0.1%和+3.0%的优势,说明在大量系统消息下进行训练也能提升对一般公众偏好的对齐。我们的代码、数据集、基准测试及模型已发布于https://github.com/kaistAI/Janus。

关键词

引用

@article{arxiv.2405.17977,
  title  = {Aligning to Thousands of Preferences via System Message Generalization},
  author = {Seongyun Lee and Sue Hyun Park and Seungone Kim and Minjoon Seo},
  journal= {arXiv preprint arXiv:2405.17977},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024