OpenChat:利用混合质量数据推进开源语言模型
计算与语言
2024-03-19 v2
摘要
如今,诸如 LLaMA 之类的开源大语言模型已经涌现。近期的发展引入了监督微调(SFT)与强化学习微调(RLFT)以将这些模型与人类目标对齐。然而,SFT 方法平等对待所有混合质量的训练数据,而 RLFT 方法需要高质量的成对或基于排序的偏好数据。在本研究中,我们提出一个名为 OpenChat 的新框架,利用混合质量数据推进开源语言模型。具体而言,我们考虑通用的 SFT 训练数据,其由少量专家数据与大量次优数据混合而成,且没有任何偏好标签。我们提出了 C(onditioned)-RLFT,它将不同数据源视为粗粒度奖励标签,并学习一个类条件策略以利用互补的数据质量信息。有趣的是,C-RLFT 中的最优策略可通过单阶段、无 RL 的监督学习轻松求解,该方法轻量且避免了昂贵的人类偏好标注。通过在三个标准基准上的大量实验,我们使用 C-RLFT 微调的 openchat-13b 在所有 13b 开源语言模型中取得了最高的平均性能。此外,我们使用 AGIEval 验证模型泛化性能,其中仅有 openchat-13b 超越了基础模型。最后,我们进行了一系列分析以阐明 OpenChat 的有效性与鲁棒性。我们的代码、数据与模型公开于 https://github.com/imoneoi/openchat 与 https://huggingface.co/openchat。
引用
@article{arxiv.2309.11235,
title = {OpenChat: Advancing Open-source Language Models with Mixed-Quality Data},
author = {Guan Wang and Sijie Cheng and Xianyuan Zhan and Xiangang Li and Sen Song and Yang Liu},
journal= {arXiv preprint arXiv:2309.11235},
year = {2024}
}