中文

通过增量数据分配选择近最优学习器

机器学习 2016-01-05 v1 机器学习

摘要

我们研究了一种新颖的机器学习(ML)问题设定,即在大量分类器中顺序分配训练数据的小子集。目标是选择一个在所有数据上训练时能给出近最优准确性的分类器,同时最小化误分配样本的成本。其动机源于具有许多学习算法与超参数组合的现代大型数据集和ML工具包。受“不确定性下的乐观主义”原则启发,我们提出了一种创新策略——使用上界的数据分配(Data Allocation using Upper Bounds, DAUB),该策略在多种真实世界数据集上鲁棒地实现了这些目标。我们进一步在理想化设定下为DAUB提供了坚实的理论支持,其中训练于 nn 个样本的分类器的期望准确性可被精确获知。在这些条件下,我们建立了该方法后悔值(就误分配数据而言)的严格次线性界,以及所选分类器次优性的严格界。我们使用真实世界数据集的准确率估计仅轻微违背理论场景,表明DAUB的实际行为可能接近理想化行为。

关键词

引用

@article{arxiv.1601.00024,
  title  = {Selecting Near-Optimal Learners via Incremental Data Allocation},
  author = {Ashish Sabharwal and Horst Samulowitz and Gerald Tesauro},
  journal= {arXiv preprint arXiv:1601.00024},
  year   = {2016}
}

备注

AAAI-2016: The Thirtieth AAAI Conference on Artificial Intelligence