中文

机器学习流水线中的预处理器选择

机器学习 2018-10-24 v1 机器学习

摘要

元学习(metalearning)中的许多工作聚焦于分类器选择,近来与超参数优化相结合,却很少关注数据预处理。然而,人们普遍公认机器学习应用不仅需要模型构建,还需要数据预处理。换言之,实际的解决方案由机器学习算子的流水线而非单一算法组成。有趣的是,我们的实验表明,平均而言数据预处理会妨碍准确率,而性能最佳的流水线确实使用了预处理器。在此,我们在广泛的学习算法与预处理器上进行了大量实证研究,并利用元学习来确定在机器学习流水线设计中何时应当使用预处理器。

关键词

引用

@article{arxiv.1810.09942,
  title  = {Preprocessor Selection for Machine Learning Pipelines},
  author = {Brandon Schoenfeld and Christophe Giraud-Carrier and Mason Poggemann and Jarom Christensen and Kevin Seppi},
  journal= {arXiv preprint arXiv:1810.09942},
  year   = {2018}
}

备注

Accepted at the ICML 2018 AutoML Workshop