Hydra:为模型蒸馏保留集成多样性
机器学习
2021-03-22 v2 机器学习
摘要
模型集成已在经验上被证明能够改善预测性能并提供稳健的不确定性度量。然而,它们在计算和内存上是昂贵的。因此,近期的研究聚焦于将集成蒸馏为单个紧凑模型,在降低集成的计算和内存负担的同时,试图保留其预测行为。大多数现有的蒸馏公式通过捕捉集成的平均预测来概括集成。结果,源自每个成员的集成预测多样性丢失了。因此,蒸馏模型无法提供与原始集成相当的不确定性度量。为了更忠实地保留集成的多样性,我们提出一种基于单个多头神经网络的蒸馏方法,称之为 Hydra。共享的主体网络学习联合特征表示,使每个头能够捕捉每个集成成员的预测行为。我们证明,在参数数量略有增加的情况下,Hydra 在分类和回归设定上改善了蒸馏性能,同时在分布内和分布外任务上捕捉原始集成的不确定性行为。
引用
@article{arxiv.2001.04694,
title = {Hydra: Preserving Ensemble Diversity for Model Distillation},
author = {Linh Tran and Bastiaan S. Veeling and Kevin Roth and Jakub Swiatkowski and Joshua V. Dillon and Jasper Snoek and Stephan Mandt and Tim Salimans and Sebastian Nowozin and Rodolphe Jenatton},
journal= {arXiv preprint arXiv:2001.04694},
year = {2021}
}
备注
Accepted to ICML 2020 Workshop on Uncertainty and Robustness in Deep Learning