重访架构感知知识蒸馏:更小模型与更快搜索
机器学习
2022-06-28 v1
摘要
知识蒸馏(KD)近来已成为压缩神经网络的一种流行方法。在近期研究中,提出了同时寻找学生模型参数与架构的广义蒸馏方法。然而,该搜索方法需要大量计算来搜索架构,且存在其搜索空间仅考虑卷积块的缺点。本文引入一种新算法,称为信任域感知架构搜索以有效蒸馏知识(TRADE),其利用信任域贝叶斯优化方法从多个最先进架构中快速找到有效的学生架构。实验结果表明,我们提出的 TRADE 算法在 KD 训练下始终优于传统的 NAS 方法与预定义架构。
引用
@article{arxiv.2206.13130,
title = {Revisiting Architecture-aware Knowledge Distillation: Smaller Models and Faster Search},
author = {Taehyeon Kim and Heesoo Myeong and Se-Young Yun},
journal= {arXiv preprint arXiv:2206.13130},
year = {2022}
}
备注
Presented in ICML 2022 Hardware Aware Efficient Training (HAET) Workshop