中文

展示、注意力与蒸馏:基于注意力的特征匹配知识蒸馏

机器学习 2021-02-08 v1

摘要

知识蒸馏从预训练的教师网络中提取通用知识,并为目标学生网络提供指导。大多数研究手动关联教师与学生网络的中间特征,并通过预定义的连接传递知识。然而,手动选择常常构建低效的连接,限制了蒸馏带来的提升。已有尝试解决该问题,但在实际场景下识别有效连接仍具挑战性。本文提出一种有效且高效的特征蒸馏方法,利用教师网络的所有特征层级而无需手动选择连接。具体而言,我们的方法采用基于注意力的元网络学习特征间的相对相似性,并应用识别出的相似性来控制所有可能特征对之间的蒸馏强度。因此,与先前方法相比,我们的方法能更高效地确定有效连接,并在模型压缩与迁移学习任务上提供更好的性能。进一步的定性分析与消融实验阐明了我们的方法如何促成更好的蒸馏。实现代码见 github.com/clovaai/attention-feature-distillation。

关键词

引用

@article{arxiv.2102.02973,
  title  = {Show, Attend and Distill:Knowledge Distillation via Attention-based Feature Matching},
  author = {Mingi Ji and Byeongho Heo and Sungrae Park},
  journal= {arXiv preprint arXiv:2102.02973},
  year   = {2021}
}

备注

10 page, AAAI 2021