BabyLlama-2:基于Ensemble-Distilled模型在数据有限条件下超越教师模型
计算与语言
2024-09-27 v1 机器学习
摘要
我们提出BabyLlama-2,这是一个3.45亿参数的模型,通过在1000万词语语料库上从两个教师模型进行蒸馏预训练,以适应BabyLM竞赛。实验表明,BabyLlama-2在BLiMP和SuperGLUE基准测试中,优于在相同数据混合下分别使用1000万词语和1亿词语数据集训练的基线模型,以及其教师模型。通过进行广泛的超参数扫描,我们表明蒸馏的优势并非源于教师模型的超参数选择不佳。我们的发现凸显了在数据有限环境下,对蒸馈技术进一步调查的必要性。
引用
@article{arxiv.2409.17312,
title = {BabyLlama-2: Ensemble-Distilled Models Consistently Outperform Teachers With Limited Data},
author = {Jean-Loup Tastet and Inar Timiryasov},
journal= {arXiv preprint arXiv:2409.17312},
year = {2024}
}
备注
9 pages, 3 figures, 5 tables, submitted to the BabyLM Challenge (CoNLL 2024 Shared Task)