中文

基于响应、特征与关系的知识蒸馏类别综述

计算机视觉与模式识别 2023-06-21 v1

摘要

深度神经网络在人工智能任务上取得了卓越性能。智能系统背后的成功往往依赖于具有高计算复杂度和存储成本的大规模模型。这些过参数化网络通常易于优化且能获得更好性能。然而,在资源受限的边缘设备上部署它们颇具挑战。知识蒸馏(KD)旨在从过参数化训练的角度优化轻量级网络。传统的离线KD将知识从笨重的教师网络迁移到小巧快速的学生网络。当无法获得大型预训练教师网络时,在线KD可通过协作或互学习提升一组模型。无需额外模型,自KD利用附加的辅助架构增强网络自身。KD主要涉及知识提取与蒸馏策略这两个方面。除KD方案外,多种KD算法广泛应用于实际中,如多教师KD、跨模态KD、基于注意力的KD、无数据KD与对抗KD。本文提供全面的KD综述,涵盖知识类别、蒸馏方案与算法,以及一些关于性能比较的实证研究。最后,我们讨论了现有KD工作的开放挑战并展望了未来方向。

关键词

引用

@article{arxiv.2306.10687,
  title  = {Categories of Response-Based, Feature-Based, and Relation-Based Knowledge Distillation},
  author = {Chuanguang Yang and Xinqiang Yu and Zhulin An and Yongjun Xu},
  journal= {arXiv preprint arXiv:2306.10687},
  year   = {2023}
}

备注

Published at Springer book "Advancements in Knowledge Distillation: Towards New Horizons of Intelligent Systems"