HodgeCover: 高阶拓扑覆盖驱动稀疏混合专家的压缩
机器学习
2026-05-15 v1 人工智能
计算与语言
摘要
稀疏混合专家层通过少量专家路由 token,对这些层的免学习压缩可在无需重训练的情况下降低推理成本。一个微妙的障碍阻碍了该家族中的每一个现有压缩器:三个专家可以两两兼容,但在合并在一起时却形成一个不可约循环,因此任何基于成对信号对专家进行排序的评分在结构上都无法察觉哪些三元组是可以联合合并的。我们证明该障碍是一个精确的数学对象,即单纯形拉普拉斯算子在 2-复形上的调和核,该复形的顶点是专家,其边承载 KL 合并障碍,其面承载三元组障碍;对边障碍信号进行 Hodge 分解可以精确隔离该核。我们将这一诊断转化为一个选择目标:HodgeCover 贪心地覆盖调和临界边和三元组临界三角形,并且 HodgeCover 的混合变体将其与现成的针对幸存者的权重剪枝相配合。在三个开放权重的稀疏 MoE 主干网络上进行激进的专家缩减时,HodgeCover 在专家缩减轴上匹配了最先进的免学习基线,在混合轴的激进压缩前沿上处于领先地位,并且在所有四个 Hodge 分量上独特地平衡了保留的质量。这些结果表明,暴露学习到的 MoE 结构的调和核会改变在最重要的机制下哪个压缩器胜出。
引用
@article{arxiv.2605.13997,
title = {HodgeCover: Higher-Order Topological Coverage Drives Compression of Sparse Mixture-of-Experts},
author = {Tao Zhong and Dongzhe Zheng and Christine Allen-Blanchette},
journal= {arXiv preprint arXiv:2605.13997},
year = {2026}
}
备注
34 pages, 8 figures