中文

1.5 品斤技术报告:以质量数据实现天级预训练——你的语言模型需要优质数据

计算与语言 2024-08-08 v1

摘要

本文提出一种高效的预训练语言模型方法——“1.5 品斤”方案,仅用 9 天即可完成预训练,同时在 MT-Bench(模拟人类判断的基准测试)上超越 Apple 的 OpenELM 和 Microsoft 的 Phi。通过精心筛选的 570 亿 token 数据集实现,采用自动化工作流程和人工人工审核相结合的方式。数据集的选择优先考虑被视为 expository 和“教科书式”内容,以帮助模型进行推理和逻辑推演,最终使其成为一个强大且多功能的 AI 模型。就模型架构而言,我们采用了修改版的 Mistral tokenizer,以及与 Llama-2 架构兼容的设计。训练方面,我们采用了 StableLM、TinyLlama 和 Huggingface Zephyr 的方法。1.5 品斤模型表明,通过在 LLM 训练中关注数据质量而非数量,可以显著缩短训练时间和资源消耗。我们认为,这一方法不仅会使预训练更具可及性,还能减少碳足迹。本研究的发现和资源已开源,旨在推动该领域的进一步发展。1.5 品斤模型提供两个版本:2K 和 16K 上下文窗口。

关键词

引用

@article{arxiv.2408.03506,
  title  = {1.5-Pints Technical Report: Pretraining in Days, Not Months -- Your Language Model Thrives on Quality Data},
  author = {Calvin Tan and Jerome Wang},
  journal= {arXiv preprint arXiv:2408.03506},
  year   = {2024}
}

备注

Technical Report for 1.5-Pints