面向知识蒸馏的按角色数据增强
机器学习
2020-04-21 v1 神经与进化计算
机器学习
摘要
知识蒸馏(KD)是一种将某个机器学习模型(教师模型)学到的“知识”迁移到另一个模型(学生模型)中的常用方法,其中教师模型通常具有更大的容量(例如更多参数或更高位宽)。据我们所知,现有方法忽视了一个事实:尽管学生模型从教师模型吸收额外知识,但两个模型共享相同的输入数据——而该数据是展示教师知识的唯一媒介。由于模型容量不同,学生模型可能无法从教师模型所训练的相同数据点中充分受益。另一方面,人类教师可能会用适应特定学生(例如根据其文化背景和兴趣)的个性化示例来演示某条知识。受此行为启发,我们设计了具有不同角色的的数据增强代理以促进知识蒸馏。我们的数据增强代理分别为教师和学生生成不同的训练数据。我们通过实验发现,专门定制的数据点能够更有效地向学生展示教师的知识。我们在训练流行的神经架构上将我们的方法与现有 KD 方法进行比较,并证明按角色数据增强比强大的已有方法提升了 KD 的有效性。复现我们结果的代码可在 https://github.com/bigaidream-projects/role-kd 找到。
引用
@article{arxiv.2004.08861,
title = {Role-Wise Data Augmentation for Knowledge Distillation},
author = {Jie Fu and Xue Geng and Zhijian Duan and Bohan Zhuang and Xingdi Yuan and Adam Trischler and Jie Lin and Chris Pal and Hao Dong},
journal= {arXiv preprint arXiv:2004.08861},
year = {2020}
}