μ-MoE:作为细粒度专家混合的测试时剪枝
机器学习
2025-05-27 v1 人工智能
计算与语言
摘要
为了应对大型基础模型巨大的计算需求,无需重新训练的激活感知压缩技术已被引入。然而,由于这些技术依赖校准数据,对于未知的下游任务可能出现域偏移。通过计算高效的校准,激活感知剪枝可以为每个提示自适应地执行,从而在推理时降低复杂度。我们将其形式化为一种细粒度专家混合,称为 μ-MoE。多个实验表明,μ-MoE 可以在运行时动态适应任务/提示依赖的结构化稀疏。
引用
@article{arxiv.2505.18451,
title = {$\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts},
author = {Toshiaki Koike-Akino and Jing Liu and Ye Wang},
journal= {arXiv preprint arXiv:2505.18451},
year = {2025}
}
备注
10 pages, 4 figures