用于知识蒸馏的三元组损失
机器学习
2020-04-20 v1 计算机视觉与模式识别
摘要
近年来深度学习迅速普及,更深、更大的模型相继被提出。然而,随着模型规模增大,计算成本变得极其庞大。为在降低计算成本的同时提升性能,人们提出了多种压缩模型规模的技术。知识蒸馏(KD)便是其中一种压缩模型规模的方法。知识蒸馏是一种将参数众多的深度或集成模型(教师模型)的知识迁移至更小的浅层模型(学生模型)的技术。由于知识蒸馏旨在提升教师模型与学生模型的相似性,我们提出将度量学习的概念引入知识蒸馏,利用训练样本的对或三元组使学生模型更接近教师模型。在度量学习中,研究者们正开发能够提升相似样本输出相似性的建模方法。度量学习旨在缩小相似样本间的距离并增大不相似样本间的距离。度量学习缩小相似输出差异的功能可用于知识蒸馏,以减小教师模型与学生模型输出间的差异。由于教师模型对不同对象的输出通常不同,学生模型需对其加以区分。我们认为度量学习能厘清不同输出间的差异,从而可提升学生模型的性能。我们已通过实验将所提方法与最先进的知识蒸馏方法进行比较。
引用
@article{arxiv.2004.08116,
title = {Triplet Loss for Knowledge Distillation},
author = {Hideki Oki and Motoshi Abe and Junichi Miyao and Takio Kurita},
journal= {arXiv preprint arXiv:2004.08116},
year = {2020}
}
备注
Accepted to IJCNN 2020, Source code is at https://github.com/i13abe/Triplet-Loss-for-Knowledge-Distillation