中文

一种利用知识蒸馏训练回归问题小型模型的高效方法

机器学习 2020-03-02 v1 计算机视觉与模式识别 机器学习

摘要

压缩深度神经网络(DNN)模型成为现实应用(例如在移动设备上部署这些模型)中非常重要且必要的技术。知识蒸馏是模型压缩最流行的方法之一,许多研究致力于发展该技术。然而,这些研究主要关注分类问题,尽管DNN在回归问题上有许多应用,但对回归问题的尝试极少。本文提出一种用于回归问题的知识蒸馏新形式。首先,我们提出一种新的损失函数——教师异常值拒绝损失,其利用教师模型预测拒绝训练样本中的异常值。其次,我们考虑一个具有两个输出的多任务网络:一个估计训练标签(通常受噪声标签污染);另一个估计教师模型的输出,期望依据记忆效应修正噪声标签。通过考虑该多任务网络,学生模型的特征提取训练变得更加有效,并且使我们能获得比从头训练更好的学生模型。我们使用一个简单的玩具模型(正弦函数)和两个开放数据集(MPIIGaze和Multi-PIE)进行了综合评估。我们的结果表明,无论数据集中标注误差水平如何,准确率均有持续提升。

关键词

引用

@article{arxiv.2002.12597,
  title  = {An Efficient Method of Training Small Models for Regression Problems with Knowledge Distillation},
  author = {Makoto Takamoto and Yusuke Morishita and Hitoshi Imaoka},
  journal= {arXiv preprint arXiv:2002.12597},
  year   = {2020}
}

备注

7 pages, 2 figures, draft version of a paper accepted for IEEE 3rd International Conference on Multimedia Information Processing and Retrieval (MIPR2020)