先剪枝,再蒸馏
机器学习
2022-07-26 v3
摘要
知识蒸馏将知识从笨重的教师模型迁移至小型学生模型。近期结果表明,便于学生学习的教师模型更适于蒸馏,因其提供更可迁移的知识。本工作中,我们提出新颖框架“先剪枝,再蒸馏”,即先对模型剪枝以使其更具可迁移性,再蒸馏至学生模型。我们提供了若干探索性示例,其中剪枝后的教师模型比原始未剪枝网络教得更好。我们进一步从理论表明,剪枝后的教师在蒸馏中起到正则化器作用,降低了泛化误差。基于此结果,我们提出一种新颖的神经网络压缩方案,其中学生网络基于剪枝后的教师模型构建,然后应用“先剪枝,再蒸馏”策略。代码见 https://github.com/ososos888/prune-then-distill
引用
@article{arxiv.2109.14960,
title = {Prune Your Model Before Distill It},
author = {Jinhyuk Park and Albert No},
journal= {arXiv preprint arXiv:2109.14960},
year = {2022}
}
备注
Accepted at ECCV2022