中文

通过代理目标将集成分布蒸馏扩展至众多类别

机器学习 2021-05-17 v1 人工智能 机器学习

摘要

机器学习模型的集成可提升系统性能,并提供鲁棒且可解释的不确定性估计;然而,其推理成本常高得令人望而却步。\emph{集成分布蒸馏}(Ensemble Distribution Distillation)是一种使单一模型高效捕获集成的预测性能与不确定性估计的方法。对于分类,这是通过最大似然准则在集成成员输出分布上训练 Dirichlet 分布来实现的。尽管在理论上有原则,该准则在类别数极多的大规模任务上应用时表现出较差的收敛性。在我们的工作中,我们分析此效应,并表明 Dirichlet 对数似然准则中低概率类别比较之高概率类别诱导更大的梯度。这迫使模型聚焦于集成长尾类别概率的分布。我们提出一种新的训练目标,最小化到源自集成的\emph{代理 Dirichlet}(Proxy-Dirichlet)目标的反向 KL 散度。该损失解决了集成分布蒸馏的梯度问题,正如我们在包含 1000 与 40,000 个类别的 ImageNet 与 WMT17 En-De 数据集上从理论与经验两方面所展示的。

关键词

引用

@article{arxiv.2105.06987,
  title  = {Scaling Ensemble Distribution Distillation to Many Classes with Proxy Targets},
  author = {Max Ryabinin and Andrey Malinin and Mark Gales},
  journal= {arXiv preprint arXiv:2105.06987},
  year   = {2021}
}