中文

聚类在预测任务中的效用

机器学习 2015-09-22 v1

摘要

我们探索聚类在减少各种预测任务误差方面的效用。先前的工作暗示了如果使用聚类算法对数据进行预处理,可提高预测精度。在本工作中,我们更深入地研究了使用聚类提高预测精度的直接效用,并解释了为何可能如此。我们考察了多个数据集,在不同规模上运行 k-means,并对每个规模训练预测器。这产生了 k 组预测。这些预测随后通过朴素集成进行组合。我们观察到,这种将预测器与聚类结合使用的方法在大多数数据集中提高了预测精度。我们认为这表明利用数据中结构的预测效用以及聚类所提供的数据压缩。我们还发现,使用该方法甚至优于随机森林(Random Forests)预测器的预测,这表明该方法在预测过程中提供了一种新颖且有用的方差来源。

关键词

引用

@article{arxiv.1509.06163,
  title  = {The Utility of Clustering in Prediction Tasks},
  author = {Shubhendu Trivedi and Zachary A. Pardos and Neil T. Heffernan},
  journal= {arXiv preprint arXiv:1509.06163},
  year   = {2015}
}

备注

An experimental research report, dated 11 September 2011