中文

先剪枝,再蒸馏

机器学习 2022-07-26 v3

摘要

知识蒸馏将知识从笨重的教师模型迁移至小型学生模型。近期结果表明,便于学生学习的教师模型更适于蒸馏,因其提供更可迁移的知识。本工作中,我们提出新颖框架“先剪枝,再蒸馏”,即先对模型剪枝以使其更具可迁移性,再蒸馏至学生模型。我们提供了若干探索性示例,其中剪枝后的教师模型比原始未剪枝网络教得更好。我们进一步从理论表明,剪枝后的教师在蒸馏中起到正则化器作用,降低了泛化误差。基于此结果,我们提出一种新颖的神经网络压缩方案,其中学生网络基于剪枝后的教师模型构建,然后应用“先剪枝,再蒸馏”策略。代码见 https://github.com/ososos888/prune-then-distill

关键词

引用

@article{arxiv.2109.14960,
  title  = {Prune Your Model Before Distill It},
  author = {Jinhyuk Park and Albert No},
  journal= {arXiv preprint arXiv:2109.14960},
  year   = {2022}
}

备注

Accepted at ECCV2022