TinyHelen的首个课程:在更简单语言环境中训练与评估小型语言模型
计算与语言
2025-01-03 v1 人工智能
摘要
训练语言模型(LM)及其应用代理因大规模数据集和模型而日益昂贵,导致测试失败成本较高。简化语言环境作为原始训练和测试场所,保留基本常识和交流技能但呈现更易消化的形式,可能提高LM的学习效率,从而减少有效训练和评估所需的模型规模和数据量。在这些简化语言环境中,针对小模型、数据集和代理的可行策略可能适用于复杂语言环境中更大的模型、数据集和代理。为创建此类环境,我们关注两个方面:i)最小化语言数据集的噪声和复杂性,ii)保留基本文本分布特征。不同于先前方法,我们提出了一套以消除噪声、最小化词汇表并维持特定流派模式(例如书籍、对话、代码等)的管道来精炼文本数据的方案。通过实现该管道,我们创建了一套更精简的LM训练与评估数据集:71M Leaner-Pretrain、7M Leaner-Instruct、Leaner-Glue 用于评估语言熟练力,以及 Leaner-Eval 用于测试指令遵循能力。我们的实验表明,精简预训练可提升LM的学习效率。在不同语言细粒度水平上,训练于这些数据集的小型LM相较于训练于原始数据集的模型在指令遵循方面表现更佳。此外,Leaner-Pretrain 数据集与传统大型LM训练集的对齐,使我们能够资源优化地分析学习目标、模型架构和训练技术对语言建模及下游任务性能的影响。我们的代码和数据集已在 https://github.com/EmpathYang/TinyHelen.git 上公开。
引用
@article{arxiv.2501.00522,
title = {TinyHelen's First Curriculum: Training and Evaluating Tiny Language Models in a Simpler Language Environment},
author = {Ke Yang and Volodymyr Kindratenko and ChengXiang Zhai},
journal= {arXiv preprint arXiv:2501.00522},
year = {2025}
}