小模型应读什么?探索样本高效数据组合对模型性能的影响
计算与语言
2024-11-12 v1 人工智能
摘要
我们探讨了预训练数据组成对小型语言模型在样本高效 setting 下性能的影响。使用限制为 1000 万词的 datasets,我们评估了多个数据源,包括儿童导向语音 (CHILDES)、经典书籍 (Gutenberg)、合成数据 (TinyStories) 以及这些组合 (Mix),跨不同模型规模,从 1800 万到 7.05 亿参数。我们的实验表明,较小的模型(如 GPT2-97M、GPT2-705M、Llama-360M)在训练更复杂和丰富的 datasets(如 Gutenberg)时表现更佳。在所有模型规模下,训练 CHILDES 和 TinyStories 数据集的模型表现均较差。这些发现表明,样本高效训练的最佳 datasets 取决于模型规模,且儿童导向语音和简化故事均非所有模型规模的最佳选择。我们强调在有效的样本高效语言模型训练中,需同时考虑 datasets 组成和模型容量。
引用
@article{arxiv.2411.06672,
title = {What Should Baby Models Read? Exploring Sample-Efficient Data Composition on Model Performance},
author = {Hong Meng Yam and Nathan J Paek},
journal= {arXiv preprint arXiv:2411.06672},
year = {2024}
}
备注
8 pages, 6 figures, CoNLL 2024 (Shared Task) Accepted Paper