中文

通过增强蒸馏实现表格数据快速、准确且简单的模型

机器学习 2021-11-05 v1 机器学习

摘要

自动化机器学习(AutoML)可通过堆叠、装袋和提升许多个体模型(如树、深度网络和最近邻估计器)来生成复杂模型集成。尽管高度准确,但所得预测器相较于其组成模型而言体积大、速度慢且不透明。为改进AutoML在表格数据上的部署,我们提出FAST-DAD,将任意复杂的集成预测器蒸馏为提升树、随机森林和深度网络等个体模型。我们方法的核心是基于自注意力伪似然估计器的Gibbs采样数据增强策略。在涵盖回归与二分类/多分类任务的30个数据集上,FAST-DAD蒸馏产生的个体模型显著优于在原始数据上通过标准训练获得的模型。我们的个体蒸馏模型比H2O/AutoSklearn等AutoML工具生成的集成预测器快10倍以上且更准确。

关键词

引用

@article{arxiv.2006.14284,
  title  = {Fast, Accurate, and Simple Models for Tabular Data via Augmented Distillation},
  author = {Rasool Fakoor and Jonas Mueller and Nick Erickson and Pratik Chaudhari and Alexander J. Smola},
  journal= {arXiv preprint arXiv:2006.14284},
  year   = {2021}
}