IMU-1:小型语言模型的样本高效预训练
机器学习
2026-02-04 v1 人工智能
摘要
我们提出IMU-1,一个4.3亿参数的语言模型,其在720亿标记上的训练,接近使用56倍更多数据的模型性能。我们描述了一种经验证的训练配方,结合最新架构干预(QK-norm注意力、每头门控、值残差、LayerNorm比例缩放)与优化进展(NorMuon配合谨慎权重衰减、muP参数化),以及具有后验EMA的三阶段训练计划。我们提供了每个组件的消融实验,并发布代码、权重和数据,以便实现可重复性:https://huggingface.co/thepowerfuldeez/imu1_base
引用
@article{arxiv.2602.02522,
title = {IMU-1: Sample-Efficient Pre-training of Small Language Models},
author = {George Grigorev},
journal= {arXiv preprint arXiv:2602.02522},
year = {2026}
}
备注
16 pages