中文

骆驼能走多远?探索开放资源上指令微调的现状

计算与语言 2023-11-01 v2

摘要

在本工作中,我们探索了近期在一系列开放指令遵循数据集上对语言模型进行指令微调的进展。尽管近期有声称称开放模型可与最先进专有模型持平,这些声称常伴随有限的评估,难以全面比较模型并确定各类资源的效用。我们提供了一组从6.7B到65B参数的指令微调模型,训练于12个指令数据集,范围从人工策划(如OpenAssistant)到合成与蒸馏(如Alpaca),并通过一组自动、基于模型与基于人类的指标,系统评估它们的 factual knowledge、推理、多语性、编程与开放式指令遵循能力。我们进一步引入T"ulu,我们基于高质量开放资源组合微调的最佳性能指令微调模型套件。我们的实验表明,不同的指令微调数据集可揭示或增强特定技能,而没有任何单一数据集(或组合)能在所有评估中提供最佳性能。有趣的是,我们发现基于模型与人类偏好的评估未能反映基于基准的评估所暴露的模型能力差异,表明需要进行本工作这类系统性评估。我们的评估显示,任何给定评估中的最佳模型平均达到ChatGPT性能的87%,以及GPT-4性能的73%,表明需要进一步投入以构建更好的基础模型与指令微调数据来缩小差距。我们在https://github.com/allenai/open-instruct发布了我们的指令微调模型,包括一个完全微调的65B T"ulu,以及我们的代码、数据与评估框架,以促进未来研究。

关键词

引用

@article{arxiv.2306.04751,
  title  = {How Far Can Camels Go? Exploring the State of Instruction Tuning on Open Resources},
  author = {Yizhong Wang and Hamish Ivison and Pradeep Dasigi and Jack Hessel and Tushar Khot and Khyathi Raghavi Chandu and David Wadden and Kelsey MacMillan and Noah A. Smith and Iz Beltagy and Hannaneh Hajishirzi},
  journal= {arXiv preprint arXiv:2306.04751},
  year   = {2023}
}

备注

18 pages, 6 figure, 10 tables. NeurIPS 2023 Datasets and Benchmarks Track Camera Ready