微型规模下的稠密与稀疏预训练:主动参数 vs 总参数匹配
计算与语言
2026-05-14 v1 机器学习
摘要
我们研究在微型规模预训练情境下,稠密和混合专家(MoE)变压器,均采用相同的LLaMA风格解码器训练配方。在稀疏模型中,用Mixtral风格的路由专家取代稠密的前馈块。在稠密基准模型中,适度调整宽度以严格匹配主动参数预算或总参数预算,而保持分词器、数据、优化器、计划、深度、上下文长度、归一化方式和评估协议不变。我们的最佳稀疏配方使用四个专家、top-2路由、Switch风格的负载平衡和路由z-loss。在三个种子的完整数据比较中,稠密主动匹配模型达到1.6545 +/- 0.0012的最佳验证损失,MoE达到1.5788 +/- 0.0020,稠密总匹配模型达到1.5608 +/- 0.0025。这导致MoE优先的匹配主动间隙为0.0758 +/- 0.0021,稠密模型优先的匹配总间隙为0.0180 +/- 0.0020。在不到2500万参数的规模下,MoE因此在主动参数匹配下改进验证损失,但未超过稠密训练在相等总存储容量下的表现。
引用
@article{arxiv.2605.13769,
title = {Dense vs Sparse Pretraining at Tiny Scale: Active-Parameter vs Total-Parameter Matching},
author = {Abdalrahman Wael},
journal= {arXiv preprint arXiv:2605.13769},
year = {2026}
}
备注
10 pages, 6 figures, 8 tables