Zephyr:语言模型对齐的直接蒸馏
机器学习
2023-10-27 v1 计算与语言
摘要
我们旨在生成一个与用户意图对齐的更小语言模型。先前的研究表明,在更大模型上应用蒸馏监督微调(dSFT)可显著提升任务准确率;然而,这些模型未对齐,即它们不能很好地响应自然提示。为蒸馏此特性,我们尝试使用来自AI反馈(AIF)的偏好数据。从由教师模型排序的输出数据集出发,我们应用蒸馏直接偏好优化(dDPO)来学习具有显著改进意图对齐的聊天模型。该方法仅需数小时训练,且在微调期间无任何额外采样。最终结果Zephyr-7B在7B参数模型的聊天基准上确立了最先进水平(SOTA),且不需要人工标注。特别地,MT-Bench上的结果表明Zephyr-7B超越了Llama2-Chat-70B,即最佳的基于RLHF的开放获取模型。该系统的代码、模型、数据和教程可在 https://github.com/huggingface/alignment-handbook 获取。
引用
@article{arxiv.2310.16944,
title = {Zephyr: Direct Distillation of LM Alignment},
author = {Lewis Tunstall and Edward Beeching and Nathan Lambert and Nazneen Rajani and Kashif Rasul and Younes Belkada and Shengyi Huang and Leandro von Werra and Clémentine Fourrier and Nathan Habib and Nathan Sarrazin and Omar Sanseviero and Alexander M. Rush and Thomas Wolf},
journal= {arXiv preprint arXiv:2310.16944},
year = {2023}
}