LaMini-LM:从大规模指令中蒸馏出的一组多样化模型
计算与语言
2024-01-30 v3
摘要
经过指令微调的大语言模型(LLM)展现出卓越的生成能力。然而,这些模型对资源消耗巨大。为缓解此问题,我们探索将指令微调后的 LLM 中的知识蒸馏到小得多的模型中。为此,我们基于已有指令和新生成的指令精心构建了一组包含 258 万条指令的大规模集合。除规模可观外,我们还设计了覆盖广泛主题的指令以确保多样性。对我们指令数据集的详尽分析证实了其多样性,并使用 gpt-3.5-turbo 为这些指令生成了回复。借助这些指令,我们微调了一组多样化的模型(统称为 LaMini-LM),其涵盖编码器-解码器与仅解码器两类架构家族中不同规模的模型。我们在 15 个不同的自然语言处理(NLP)基准上使用自动指标并通过人工评估来评测模型性能。结果表明,我们提出的 LaMini-LM 模型可与有竞争力的基线相媲美,而模型规模却小得多。
引用
@article{arxiv.2304.14402,
title = {LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions},
author = {Minghao Wu and Abdul Waheed and Chiyu Zhang and Muhammad Abdul-Mageed and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2304.14402},
year = {2024}
}
备注
21 pages, 8 figures, 17 tables, accepted by EACL2024 main conference