中文

反蒸馏:提升深度网络的可复现性

机器学习 2020-10-21 v1 神经与进化计算 机器学习

摘要

深度网络在提升机器学习与人工智能系统性能方面具有革命性意义。然而,其高预测精度是以极高的模型不可复现性为代价的,这种程度在经典线性模型中不会出现。两个模型即便架构相同、训练参数集相同且在同一训练样本集上训练,虽可能提供相同的平均预测精度,但在单个未见样本上的预测可能差异很大。预测差异可高达预测值本身的数量级。集成方法已被证明能在一定程度上缓解此现象,但若无额外推动,则可能无法发挥其全部潜力。本文提出一种新方法——反蒸馏(Anti-Distillation),以解决深度网络中的不可复现性问题,其中使用集成模型生成预测。反蒸馏通过如在小批量样本上解相关其输出等技术,迫使集成各组件彼此远离,使它们更加不同且更具多样性。如此增强了集成的益处,使最终预测更具可复现性。实证结果表明,反蒸馏在基准与真实数据集上实现了预测差异的大幅降低。

关键词

引用

@article{arxiv.2010.09923,
  title  = {Anti-Distillation: Improving reproducibility of deep networks},
  author = {Gil I. Shamir and Lorenzo Coviello},
  journal= {arXiv preprint arXiv:2010.09923},
  year   = {2020}
}