中文

MI-to-Mid Distilled Compression (M2M-DC):基于混合信息引导块剪枝与渐进式内切片的方法进行模型压缩

机器学习 2025-11-19 v2

摘要

我们提出MI-to-Mid Distilled Compression (M2M-DC),这是一种双尺度、保形安全的压缩框架,交替进行信息引导块剪枝、渐进式内切片和分阶段知识蒸馏(KD)。首先,M2M-DC依据标签感知的互信息(MI)信号对残差块(或反残差块)进行排序,并删除信息最少的单元(训练后结构化剪枝)。随后,它交替进行短时KD阶段和阶段一致、残差安全的通道切片:(i)阶段"平面"(与下采样路径和下一阶段输入共切片的conv2输出通道),以及(ii)可选的中通道修剪(conv1输出通道/bn1/conv2输入)。该方法针对互补冗余、整体计算模式以及阶段内宽度,同时保持残差形状不变。在CIFAR-100上,M2M-DC构建出干净的准确率-计算 frontier。对于ResNet-18,我们获得85.46%的Top-1准确率,3.09M参数和0.0139 GMacs(相对于教师模型为72%参数、63% GMacs;平均最终85.29%在三个随机种子上)。对于ResNet-34,我们达到85.02%的Top-1准确率,5.46M参数和0.0195 GMacs(相对于教师模型为74%/74%;平均最终84.62%)。针对反残差结构,MobileNetV2实现了平均最终68.54%的Top-1准确率,1.71M参数(27%)和0.0186 conv GMacs(24%),在三个随机种子上均超过教师模型66.03%的准确率提升了+2.5个百分点。由于M2M-DC仅暴露一个薄的、具有架构感知的接口(块、阶段和下采样/跳过连线),它能够跨ResNet类残差CNN推广,并可通过少量合法化规则扩展到反残差家族。最终得到一个紧凑、实用的部署就绪模型配方,在计算资源为教师模型的六分之一时,能够匹配或超越教师模型的准确率。

关键词

引用

@article{arxiv.2511.06842,
  title  = {MI-to-Mid Distilled Compression (M2M-DC): An Hybrid-Information-Guided-Block Pruning with Progressive Inner Slicing Approach to Model Compression},
  author = {Lionel Levine and Haniyeh Ehsani Oskouie and Sajjad Ghiasvand and Majid Sarrafzadeh},
  journal= {arXiv preprint arXiv:2511.06842},
  year   = {2025}
}