通过代理目标将集成分布蒸馏扩展至众多类别
机器学习
2021-05-17 v1 人工智能
机器学习
摘要
机器学习模型的集成可提升系统性能,并提供鲁棒且可解释的不确定性估计;然而,其推理成本常高得令人望而却步。\emph{集成分布蒸馏}(Ensemble Distribution Distillation)是一种使单一模型高效捕获集成的预测性能与不确定性估计的方法。对于分类,这是通过最大似然准则在集成成员输出分布上训练 Dirichlet 分布来实现的。尽管在理论上有原则,该准则在类别数极多的大规模任务上应用时表现出较差的收敛性。在我们的工作中,我们分析此效应,并表明 Dirichlet 对数似然准则中低概率类别比较之高概率类别诱导更大的梯度。这迫使模型聚焦于集成长尾类别概率的分布。我们提出一种新的训练目标,最小化到源自集成的\emph{代理 Dirichlet}(Proxy-Dirichlet)目标的反向 KL 散度。该损失解决了集成分布蒸馏的梯度问题,正如我们在包含 1000 与 40,000 个类别的 ImageNet 与 WMT17 En-De 数据集上从理论与经验两方面所展示的。
引用
@article{arxiv.2105.06987,
title = {Scaling Ensemble Distribution Distillation to Many Classes with Proxy Targets},
author = {Max Ryabinin and Andrey Malinin and Mark Gales},
journal= {arXiv preprint arXiv:2105.06987},
year = {2021}
}