高效数据驱动的训练网络专家提取方法
计算机视觉与模式识别
2025-05-22 v1
摘要
Vision Transformer 已成为计算机视觉任务中领先的模型,但其高计算和资源需求构成重大挑战。虽然混合专家 (MoE) 可提高模型效率,但通常需要高成本的再训练甚至从零训练。近期研究旨在通过利用预训练模型减少计算成本,这些方法显示在编码器块的多层感知机 (MLP) 中产生稀疏激活模式,允许针对每个样本仅激活相关子网络。基于此,我们提出一种新方法,从预训练模型构建 MoE 变体。该方法在两个阶段后训练后从模型的 MLP 层中提取专家子网络。第一个阶段聚类输出激活以识别不同的激活模式。在第二个阶段,我们利用这些聚类来提取产生这些激活的相应子网络。在 ImageNet-1k 识别任务上,我们展示,这些提取的专家开箱即用效果相当不错,仅需最小微调即可恢复原性能的 98%,同时通过最多降低 36% 的 MACs 和 32% 的模型大小。
引用
@article{arxiv.2505.15414,
title = {Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks},
author = {Uranik Berisha and Jens Mehnert and Alexandru Paul Condurache},
journal= {arXiv preprint arXiv:2505.15414},
year = {2025}
}
备注
Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025