中文

面向知识蒸馏的可微特征聚合搜索

机器学习 2020-08-04 v1 计算机视觉与模式识别

摘要

知识蒸馏在模型压缩中已变得日益重要。它利用来自复杂教师网络的输出分布和特征图的监督,提升小型化学生网络的性能。一些近期工作引入多教师蒸馏以向学生网络提供更多监督。然而,多教师蒸馏方法的有效性伴随着高昂的计算资源消耗。为同时解决知识蒸馏的效率与有效性问题,我们引入特征聚合,在单教师蒸馏框架中通过从多个教师特征图提取信息丰富的监督来模仿多教师蒸馏。具体而言,我们提出 DFA,一种受神经架构搜索中 DARTS 启发的两阶段可微特征聚合(Differentiable Feature Aggregation)搜索方法,以高效寻找聚合方式。在第一阶段,DFA 将搜索问题表述为双层优化,并利用一种新颖的桥接损失(其由学生到教师路径和教师到学生路径组成)来寻找合适的特征聚合。两条路径充当相互对抗的两个参与者,试图将统一的架构参数优化至相反方向,同时保证特征聚合的表达力与可学习性。在第二阶段,DFA 利用所得特征聚合执行知识蒸馏。实验结果表明,在各种师生设置下,DFA 在 CIFAR-100 和 CINIC-10 数据集上优于现有方法,验证了设计的有效性与鲁棒性。

关键词

引用

@article{arxiv.2008.00506,
  title  = {Differentiable Feature Aggregation Search for Knowledge Distillation},
  author = {Yushuo Guan and Pengyu Zhao and Bingxuan Wang and Yuanxing Zhang and Cong Yao and Kaigui Bian and Jian Tang},
  journal= {arXiv preprint arXiv:2008.00506},
  year   = {2020}
}

备注

A feature distillation method via differentiable architecture search