中文

探索利用机会性元知识缩减自动机器学习的搜索空间

机器学习 2021-05-04 v1

摘要

机器学习(ML)流水线的组合与优化已被广泛研究,以寻求既有效又表现良好的多阶段ML模型,即包含预处理器的模型。这些过程通常需要设计和遍历复杂的配置空间,其中不仅包含单个ML组件及其超参数,还包含将这些组件连接起来的更高层次的流水线结构。如果该流水线搜索空间庞大且难以驾驭,优化效率和所得ML模型的精度都会受损;因此,提前避免对表现不佳的ML组件进行代价高昂的评估成为一个诱人的思路。据此,本文研究是否可基于以往经验,在针对新ML问题(即数据集)启动流水线组合/优化过程之前,预先剔除可用分类器/回归器池中的部分项。以往经验以分类器/回归器精度排序的形式给出,这些排序是在宽松假设下从大量但非穷举的流水线评估中导出的;此元知识被视为“机会性”的。使用AutoWeka4MCPS软件包进行的众多实验,包括利用相对地标方法挖掘数据集间相似性的实验,表明尽管看似不可靠,机会性元知识仍能改善ML结果。然而,结果也表明对分类器/回归器的剔除也不宜过于严苛。实际上,在推荐的“顶级梯队”预测器中搜索,胜于将希望寄托于某个先前表现最佳的单一模型。

关键词

引用

@article{arxiv.2105.00282,
  title  = {Exploring Opportunistic Meta-knowledge to Reduce Search Spaces for Automated Machine Learning},
  author = {Tien-Dung Nguyen and David Jacob Kedziora and Katarzyna Musial and Bogdan Gabrys},
  journal= {arXiv preprint arXiv:2105.00282},
  year   = {2021}
}