ABC:大规模数据集上机器学习配置的高效选择
机器学习
2018-12-18 v2 机器学习
摘要
机器学习配置指预处理器、学习器与超参数的组合。给定一组配置以及一个随机划分为训练集与测试集的大规模数据集,我们研究如何高效选出在训练集上训练后具有近似最高测试准确率的配置。为保证较小的准确率损失,我们开发了一种基于置信区间(CI)的渐进式采样与剪枝策略的解决方案。相较于使用全量数据寻找精确最优配置,我们的方案实现了超过两个数量级的加速,同时返回的最优配置具有相同或接近的测试准确率。
引用
@article{arxiv.1811.03250,
title = {ABC: Efficient Selection of Machine Learning Configuration on Large Dataset},
author = {Silu Huang and Chi Wang and Bolin Ding and Surajit Chaudhuri},
journal= {arXiv preprint arXiv:1811.03250},
year = {2018}
}
备注
Full version of an AAAI 2019 conference paper