Moonshine:利用廉价卷积进行蒸馏
机器学习
2019-01-18 v4 计算机视觉与模式识别
机器学习
摘要
许多工程师希望在内存受限的环境中部署现代神经网络;但用于减少内存使用的灵活方法的开发尚处于起步阶段,且对其成本收益知之甚少。我们提出一种用于内存缩减的结构化模型蒸馏策略,其产生的学生架构是教师架构的简单变换:无需重新设计,且可使用相同的超参数。利用注意力迁移,我们给出了在四个基准数据集上残差网络蒸馏的Pareto曲线/表,表明了内存与精度的权衡。我们展示了以极小的精度损失实现可观的内存节省,并确认蒸馏所提供的学生网络性能优于直接在数据上训练该学生架构。
引用
@article{arxiv.1711.02613,
title = {Moonshine: Distilling with Cheap Convolutions},
author = {Elliot J. Crowley and Gavin Gray and Amos Storkey},
journal= {arXiv preprint arXiv:1711.02613},
year = {2019}
}
备注
32nd Conference on Neural Information Processing Systems (NeurIPS 2018)