渐进式集成蒸馏:构建用于高效推理的集成模型
机器学习
2023-11-10 v2
摘要
我们研究渐进式集成蒸馏问题:给定一个大型预训练教师模型 ,我们试图将其分解为更小的低推理成本学生模型 ,使得在该集成中渐进式地评估更多模型可带来更优预测。所得集成允许在运行时灵活权衡精度与推理成本,这对设备端推理的若干应用颇有帮助。我们提出的方法 B-DISTIL 依赖一种算法流程,利用中间激活上的函数组合来构建具有与 相近性能但学生模型更小的富于表现力的集成。我们通过在标准图像、语音与传感器数据集上分解预训练模型,展示了 B-DISTIL 的有效性。我们还提供了关于收敛性与泛化的理论保证。
引用
@article{arxiv.2302.10093,
title = {Progressive Ensemble Distillation: Building Ensembles for Efficient Inference},
author = {Don Kurian Dennis and Abhishek Shetty and Anish Sevekari and Kazuhito Koishida and Virginia Smith},
journal= {arXiv preprint arXiv:2302.10093},
year = {2023}
}