AUTOKD:自动将知识蒸馏至学生架构族
机器学习
2021-11-08 v1
摘要
深度学习中的最先进结果稳步提升,很大程度上得益于更大模型的使用。然而,广泛应用受限于设备硬件,导致最先进模型与可有效部署在小设备上的模型之间存在显著的性能差距。虽然知识蒸馏(KD)在理论上能使小型学生模型模仿更大的教师模型,但在实践中选择好的学生架构需要大量人类专业知识。神经架构搜索(NAS)似乎是这一问题的自然解决方案,但大多数方法可能效率低下,因为大部分计算花费在比较从同一分布中采样的架构上,性能差异可忽略不计。在本文中,我们提出转而搜索一个共享“善于从给定教师学习”这一属性的学生架构族。我们的方法AutoKD由贝叶斯优化驱动,探索灵活的基于图的搜索空间,使我们能自动学习最优学生架构分布和KD参数,同时与现有最先进方法相比样本效率高20倍。我们在3个数据集上评估我们的方法;特别是在大图像上,我们使用少3倍内存和少10倍参数达到了教师性能。最后,虽然AutoKD使用传统KD损失,它优于使用手工设计学生的更先进KD变体。
引用
@article{arxiv.2111.03555,
title = {AUTOKD: Automatic Knowledge Distillation Into A Student Architecture Family},
author = {Roy Henha Eyono and Fabio Maria Carlucci and Pedro M Esperança and Binxin Ru and Phillip Torr},
journal= {arXiv preprint arXiv:2111.03555},
year = {2021}
}
备注
12 pages, 8 figures