OpenBezoar:在指令数据混合上训练的小型、经济且开放的模型
摘要
对预训练LLMs进行指令微调以适用于各种下游任务已取得显著成功,并引起了学术界和从业者的兴趣。为了确保此类微调后的LLMs与人类偏好对齐,出现了RLHF和DPO等技术。同时,人们对模型参数数量更小的兴趣日益增加。本文以OpenLLaMA 3Bv2为基础模型,描述了用于微调OpenBezoar模型系列的配方。在该配方中:我们首先使用一个开放且商业上无限制的、基于Falcon-40B的指令微调变体,在三种方案下生成合成指令微调数据:基于LaMini-LM、WizardLM/Evol-Instruct(以databricks-dolly-15k为种子数据集)和Orca(以Flan Collection为种子数据集),然后使用GPT-4作为人类代理过滤这些生成数据。接着,我们依次对每种方案进行基于QLoRA的成本效益监督微调。得到的检查点进一步使用HH-RLHF数据集的一个子集进行微调,以最小化分布偏移,然后使用DPO损失获得最终检查点。评估使用LM Eval Harness任务/指标以及MT-Bench上的“LLM-as-a-judge”框架(使用Claude 2.1)进行,结果发现最终检查点“OpenBezoar-HH-RLHF-DPO”在3B参数规模上表现出优于许多模型的性能,甚至在Huggingface Open LLM排行榜的一个类别中超越了顶级模型。我们发布了“OpenBezoar-SFT”、“OpenBezoar-HH-RLHF-SFT”、“OpenBezoar-HH-RLHF-DPO”检查点,以及我们在HuggingFace上生成的数据集(https://huggingface.co/collections/SurgeGlobal/open-bezoar-6620a24923e12127e9e2b9cc)和代码库(https://bitbucket.org/paladinanalytics/workspace/projects/OP)。
引用
@article{arxiv.2404.12195,
title = {OpenBezoar: Small, Cost-Effective and Open Models Trained on Mixes of Instruction Data},
author = {Chandeepa Dissanayake and Lahiru Lowe and Sachith Gunasekara and Yasiru Ratnayake},
journal= {arXiv preprint arXiv:2404.12195},
year = {2024}
}
备注
25 pages, 27 Figures, 8 Tables