利用随机算法调优实现大数据的自动化机器学习
机器学习
2014-07-31 v1
摘要
我们介绍了一种针对大数据任务自动化机器学习 (ML) 的方法,即通过对 ML 算法参数和超参数进行可扩展的随机贝叶斯优化。通常情况下,ML 算法参数的关键调优依赖于专家的专业知识,以及繁琐的手动调优、暴力搜索或耗时的采样运行。在此背景下,贝叶斯优化在自动化参数调优方面得到了越来越多的应用,使得非专家也能使用 ML 算法。然而,现有的贝叶斯优化技术无法扩展到将现实模型拟合到复杂大数据所需的巨量算法性能评估中。我们在此描述了一种随机的、稀疏的贝叶斯优化策略来解决这一问题,利用对数据子集上算法性能的数千次噪声评估来有效地训练大数据算法。我们对贝叶斯优化可能的稀疏化策略进行了全面的基准测试,结论是 Nystrom 近似为实际任务提供了最佳的扩展性和性能。我们提出的算法在针对真实大数据的高斯过程时间序列预测任务的参数调优方面,显示出相较于现有技术的显著改进。
引用
@article{arxiv.1407.7969,
title = {Automated Machine Learning on Big Data using Stochastic Algorithm Tuning},
author = {Thomas Nickson and Michael A Osborne and Steven Reece and Stephen J Roberts},
journal= {arXiv preprint arXiv:1407.7969},
year = {2014}
}