中文

渐进式集成蒸馏:构建用于高效推理的集成模型

机器学习 2023-11-10 v2

摘要

我们研究渐进式集成蒸馏问题:给定一个大型预训练教师模型 gg,我们试图将其分解为更小的低推理成本学生模型 fif_i,使得在该集成中渐进式地评估更多模型可带来更优预测。所得集成允许在运行时灵活权衡精度与推理成本,这对设备端推理的若干应用颇有帮助。我们提出的方法 B-DISTIL 依赖一种算法流程,利用中间激活上的函数组合来构建具有与 gg 相近性能但学生模型更小的富于表现力的集成。我们通过在标准图像、语音与传感器数据集上分解预训练模型,展示了 B-DISTIL 的有效性。我们还提供了关于收敛性与泛化的理论保证。

关键词

引用

@article{arxiv.2302.10093,
  title  = {Progressive Ensemble Distillation: Building Ensembles for Efficient Inference},
  author = {Don Kurian Dennis and Abhishek Shetty and Anish Sevekari and Kazuhito Koishida and Virginia Smith},
  journal= {arXiv preprint arXiv:2302.10093},
  year   = {2023}
}