中文

IMU-1:小型语言模型的样本高效预训练

机器学习 2026-02-04 v1 人工智能

摘要

我们提出IMU-1,一个4.3亿参数的语言模型,其在720亿标记上的训练,接近使用56倍更多数据的模型性能。我们描述了一种经验证的训练配方,结合最新架构干预(QK-norm注意力、每头门控、值残差、LayerNorm比例缩放)与优化进展(NorMuon配合谨慎权重衰减、muP参数化),以及具有后验EMA的三阶段训练计划。我们提供了每个组件的消融实验,并发布代码、权重和数据,以便实现可重复性:https://huggingface.co/thepowerfuldeez/imu1_base

关键词

引用

@article{arxiv.2602.02522,
  title  = {IMU-1: Sample-Efficient Pre-training of Small Language Models},
  author = {George Grigorev},
  journal= {arXiv preprint arXiv:2602.02522},
  year   = {2026}
}

备注

16 pages