对机器学习应用准确性的早期预测
机器学习
2012-12-06 v1 人工智能
机器学习
摘要
机器学习系统的准确性是一个被广泛研究的课题。交叉验证等成熟技术可以预测将给定学习方法应用于给定训练数据集所产生的分类器在未见数据上的准确性。然而,它们无法预测投入更多数据获取成本并进行进一步训练是否会带来更高的准确性。在本文中,我们研究了进行此类早期预测的技术。我们注意到,当机器学习算法面对训练集时,所产生的分类器及其误差将取决于算法的特性、训练集的大小及其具体构成。特别是,我们假设如果生成多个分类器,并将其观测误差分解为偏差和方差项,那么尽管这些分量可能表现不同,但它们的行为可能是可预测的。我们通过构建模型来检验这一假设,这些模型利用从有限样本生成的分类器中取得的测量值,预测当呈现完整数据集时所产生的分类器的测量值。我们分别为偏差、方差和总误差构建了独立模型。我们的模型基于将十种不同的机器学习算法应用于一系列数据集的结果构建,并使用“未见过的”算法和数据集进行了测试。我们分析了不同数量的初始训练样本和总数据集大小下的结果。结果表明,我们的预测与进行额外训练后观测到的值高度相关。最后,我们考虑了训练异构分类器集成 (ensemble) 的更复杂情况,并展示了如何准确估计进一步训练后可达到的准确性上限。
引用
@article{arxiv.1212.1100,
title = {Making Early Predictions of the Accuracy of Machine Learning Applications},
author = {J. E. Smith and P. Caleb-Solly and M. A. Tahir and D. Sannen and H. van-Brussel},
journal= {arXiv preprint arXiv:1212.1100},
year = {2012}
}
备注
35 pagers, 12 figures