多教师知识蒸馏作为压缩神经网络集成模型的有效方法
机器学习
2023-02-15 v1
摘要
近年来,深度学习为人工智能领域的诸多成功做出了巨大贡献。如今,训练具有数千层和数千亿参数的模型已成为可能。大规模深度模型取得了巨大成功,但其巨大的计算复杂度和庞大的存储需求使得在实时应用中部署它们极为困难。另一方面,数据集的规模在许多领域仍是一个现实问题。数据常常缺失、过于昂贵,或因其他原因无法获取。集成学习在一定程度上解决了小数据集和过拟合问题。然而,基础版本的集成学习伴随着计算复杂度的线性增长。我们分析了集成决策融合机制的影响,并检验了包括投票算法在内的多种决策共享方法。我们采用改进的知识蒸馏框架作为决策融合机制,该机制还可将整个集成模型压缩至单一模型的权重空间中。我们表明,知识蒸馏能够仅在一个学生模型中聚合来自多个教师的知识,并且在相同计算复杂度下,获得比标准方式训练的模型性能更优的模型。我们开发了自己的方法,用于同时模仿所有教师的响应。我们在多个基准数据集上测试了这些方案。最后,我们展示了高效多教师知识蒸馏框架的广泛应用。第一个示例中,我们利用知识蒸馏开发可自动检测飞机机身腐蚀的模型。第二个示例描述了在监控摄像头上检测烟雾以防范森林野火。
引用
@article{arxiv.2302.07215,
title = {Multi-teacher knowledge distillation as an effective method for compressing ensembles of neural networks},
author = {Konrad Zuchniak},
journal= {arXiv preprint arXiv:2302.07215},
year = {2023}
}
备注
Doctoral dissertation in the field of computer science, machine learning. Application of knowledge distillation as aggregation of ensemble models. Along with several uses. 140 pages, 67 figures, 13 tables