中文

稀疏交叉编码器:用于比较混合专家和稠密模型

机器学习 2026-03-09 v1

摘要

混合专家(MoE)通过稀疏专家路由实现参数高效扩展,但其内部表示与稠密模型相比仍 poorly understood。我们present了一种系统性比较MoE和稠密模型内部表示的方法,使用交叉编码器,这是一种稀疏自编码器的变体,能够联合建模多个激活空间。我们在代码、科学文本和英文故事上,对1B标记训练5层稠密和MoE(等效活跃参数)。使用BatchTopK交叉编码器和明确指定的共享特征,我们实现了约87%的分数方差解释,并发现特征组织的具体差异。MoE学习了显著少于稠密模型的唯一特征。MoE特有的特征也比共享特征更高的激活密度,而稠密特有的特征则表现出更低的密度。我们的分析表明,MoE发展出更专业、更聚焦的表示,而稠密模型在更广泛、更通用型的特征上分布信息。

关键词

引用

@article{arxiv.2603.05805,
  title  = {Sparse Crosscoders for diffing MoEs and Dense models},
  author = {Marmik Chaudhari and Nishkal Hundia and Idhant Gulati},
  journal= {arXiv preprint arXiv:2603.05805},
  year   = {2026}
}

备注

5 pages, 3 figures