跨数据集的超参数重要性
机器学习
2018-05-30 v2 机器学习
摘要
随着自动化机器学习的出现,自动化超参数优化方法目前在数据挖掘中已得到常规使用。然而,在提供超越性能优化超参数设置之外信息的自动分析方面,尚未取得同等进展。在本工作中,我们旨在回答以下两个问题:给定一个算法,通常最重要的超参数是什么,以及这些超参数通常的良好取值是什么?我们提出了基于跨多个数据集的元学习来回答这些问题的方法论和框架。我们利用 OpenML 上可用的实验元数据应用该方法论,以确定支持向量机、随机森林和 Adaboost 的最重要超参数,并推断其所有超参数的先验。完全自动获得的结果为在手动算法设计和自动化超参数优化中集中精力提供了定量基础。所进行的实验证实,所提方法选择的超参数确实是最重要的,并且获得的先验也在超参数优化中带来了统计学上的显著改进。
引用
@article{arxiv.1710.04725,
title = {Hyperparameter Importance Across Datasets},
author = {J. N. van Rijn and F. Hutter},
journal= {arXiv preprint arXiv:1710.04725},
year = {2018}
}
备注
\c{opyright} 2018. Copyright is held by the owner/author(s). Publication rights licensed to ACM. This is the author's version of the work. It is posted here for your personal use, not for redistribution. The definitive Version of Record was published in Proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining