一个易于使用的机器学习算法使用比较与改进仓库
机器学习
2014-06-06 v2 机器学习
摘要
大多数机器学习实验的结果仅用于特定目的,之后便被丢弃。这导致了大量信息的损失,并且需要重新运行实验来比较学习算法。同时,这也需要实现另一种算法进行比较,而该实现可能并不总是正确的。通过存储先前实验的结果,可以轻松比较机器学习算法,并利用从中获得的知识来改进其性能。本工作的目的是为学习和比较提供对先前实验结果的便捷访问。这些存储的结果是全面的——存储了每个测试实例的预测结果,以及所使用的学习算法、超参数和训练集。先前的结果对于元学习尤为重要,广义上,元学习是从先前的机器学习结果中学习以改进学习过程的过程。虽然确实存在其他实验数据库,但我们的重点之一是数据的易访问性。我们提供了可供下载的元学习数据集,用于元学习实验。此外,如果需要特定信息,可以对底层数据库进行查询。我们还与先前的实验数据库有所不同,因为我们的数据库是在实例级别设计的,其中实例是数据集中的一个样本。我们存储了针对测试集中每个实例、在特定训练集上训练的学习算法的预测结果。然后可以通过聚合实例的结果来获得数据集级别的信息。实例级别的信息可用于许多任务,例如确定分类器的多样性,或通过算法确定为学习算法选择最优的训练实例子集。
引用
@article{arxiv.1405.7292,
title = {An Easy to Use Repository for Comparing and Improving Machine Learning Algorithm Usage},
author = {Michael R. Smith and Andrew White and Christophe Giraud-Carrier and Tony Martinez},
journal= {arXiv preprint arXiv:1405.7292},
year = {2014}
}
备注
7 pages, 1 figure, 6 tables