中文

从基于决策的黑盒模型中进行零样本知识蒸馏

机器学习 2021-06-08 v1 人工智能 计算机视觉与模式识别

摘要

知识蒸馏 (knowledge distillation, KD) 是一种成功的深度神经网络加速方法,通过让紧凑网络(学生)模仿预训练高容量网络(教师)的 softmax 输出来训练。传统上,KD 通常依赖于访问训练样本和白盒教师的参数以获取迁移知识。然而,由于现实应用中存储成本或隐私问题,这些前提并非总可行。本文提出基于决策的黑盒 (decision-based black-box, DB3) 知识蒸馏的概念,学生通过从仅返回类别而非 softmax 输出的黑盒教师(参数不可访问)蒸馏知识来训练。我们从可访问训练集的场景入手。我们通过计算样本到教师决策边界的距离来表示样本相对于其他类的鲁棒性,并用以构造每个训练样本的软标签。此后,学生可通过标准 KD 训练。我们将该方法扩展到更具挑战性的场景,即连访问训练数据也不可行。我们提出生成被教师决策边界最大程度区分的伪样本,并为其构造软标签,用作迁移集。我们在多个基准网络与数据集上评估了所提方法,实验结果证明了其有效性。代码见:https://github.com/zwang84/zsdb3kd。

关键词

引用

@article{arxiv.2106.03310,
  title  = {Zero-Shot Knowledge Distillation from a Decision-Based Black-Box Model},
  author = {Zi Wang},
  journal= {arXiv preprint arXiv:2106.03310},
  year   = {2021}
}

备注

Accepted to ICML 2021