中文

Magpie:通过无提示引导对齐的LLM从头合成对齐数据

计算与语言 2024-10-08 v2 人工智能

摘要

高质量的指令数据对于对齐大型语言模型(LLM)至关重要。尽管一些模型(如Llama-3-Instruct)开放了权重,但其对齐数据仍然是私有的,这阻碍了人工智能的民主化。高昂的人力成本和有限的、预定义的提示范围阻碍了现有的开源数据创建方法有效扩展,可能限制了公共对齐数据集的多样性和质量。是否可能通过直接从对齐的LLM中提取数据来大规模合成高质量的指令数据?我们提出了一种名为Magpie的自合成方法,用于生成大规模对齐数据。我们的关键观察是,像Llama-3-Instruct这样的对齐LLM,当我们仅输入左侧模板直到为用户消息保留的位置时,由于其自回归特性,可以生成用户查询。我们使用这种方法提示Llama-3-Instruct,生成了400万条指令及其相应的响应。我们对提取的数据进行了全面分析,并选择了30万个高质量实例。为了比较Magpie数据与其他公共指令数据集,我们使用每个数据集微调Llama-3-8B-Base,并评估微调模型的性能。我们的结果表明,在某些任务中,使用Magpie微调的模型性能与官方的Llama-3-8B-Instruct相当,尽管后者通过监督微调(SFT)和后续的反馈学习增强了1000万个数据点。我们还表明,仅使用Magpie进行SFT就可以超越先前用于SFT和偏好优化(例如使用UltraFeedback的直接偏好优化)的公共数据集的性能。这一优势在AlpacaEval、ArenaHard和WildBench等对齐基准测试中显而易见。

关键词

引用

@article{arxiv.2406.08464,
  title  = {Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing},
  author = {Zhangchen Xu and Fengqing Jiang and Luyao Niu and Yuntian Deng and Radha Poovendran and Yejin Choi and Bill Yuchen Lin},
  journal= {arXiv preprint arXiv:2406.08464},
  year   = {2024}
}

备注

Link: https://magpie-align.github.io/