变化气候中的骆驼:利用 Tulu 2 增强语言模型适配
计算与语言
2023-11-21 v2
摘要
自 TÜLU [Wang et al., 2023b] 发布以来,用于指令微调的开放资源快速发展,从更好的基础模型到新的微调技术。我们测试并将其中若干进展整合进 TÜLU,从而得到 TÜLU 2——一套改进的 TÜLU 模型,用于推进对预训练语言模型适配下游任务与用户偏好的理解和最佳实践。具体而言,我们发布:(1) TÜLU-V2-mix,一套改进的高质量指令数据集;(2) TÜLU 2,在 V2 混合数据上微调的 LLAMA-2 模型;(3) TÜLU 2+DPO,用直接偏好优化(DPO)训练的 TÜLU 2 模型,包括迄今最大的 DPO 训练模型(TÜLU 2+DPO 70B);(4) CODE TÜLU 2,在我们的 V2 混合数据上微调的 CODE LLAMA 模型,其表现优于 CODE LLAMA 及其指令微调变体 CODE LLAMA-Instruct。我们多角度的评估表明,TÜLU 2 套件在开放模型中达到最先进性能,并在多个基准上匹配或超越 GPT-3.5-turbo-0301 的性能。我们发布所有检查点、数据、训练与评估代码,以促进未来适配大语言模型的开放工作。
引用
@article{arxiv.2311.10702,
title = {Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2},
author = {Hamish Ivison and Yizhong Wang and Valentina Pyatkin and Nathan Lambert and Matthew Peters and Pradeep Dasigi and Joel Jang and David Wadden and Noah A. Smith and Iz Beltagy and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2311.10702},
year = {2023}
}
备注
technical report; fixed zephyr numbers