中文

实用知识蒸馏:利用 DNN 击败 DNN

机器学习 2023-03-02 v2 人工智能

摘要

针对表格数据集,我们探索了数据与模型蒸馏,以及数据去噪。这些技术同时改进了梯度提升模型和一种专用的 DNN 架构。尽管已知梯度提升在表格数据上优于 DNN,但我们在具有 10 万行以上的数据集上缩小了这一差距,并让 DNN 在小数据集上获得优势。我们通过输入数据蒸馏和优化集成扩展了这些结果,使 DNN 的性能达到或超过梯度提升。作为我们实用方法的理论依据,我们证明了其与经典交叉熵知识蒸馏的等价性。我们还定性地解释了在小数据集上 DNN 集成相对于 XGBoost 的优越性。对于一个每秒进行 400 万次生产推理的工业端到端实时机器学习平台,我们开发了一种基于数据采样的模型训练工作流,将模型集成蒸馏为单个梯度提升模型,该模型因高性能实时推理而受青睐,且无性能损失。实证评估表明,所提出的方法组合在已部署于全球的多个生产应用中,相较于先前最佳模型一致地提升了模型精度。

关键词

引用

@article{arxiv.2302.12360,
  title  = {Practical Knowledge Distillation: Using DNNs to Beat DNNs},
  author = {Chung-Wei Lee and Pavlos Athanasios Apostolopulos and Igor L. Markov},
  journal= {arXiv preprint arXiv:2302.12360},
  year   = {2023}
}

备注

11 pages, 1 figure, 17 tables