中文

COMET:在大规模数据上学习与使用大型集成模型的方法

机器学习 2013-03-06 v2 分布式、并行与集群计算 机器学习

摘要

COMET是一种用于大规模数据学习的单遍MapReduce算法。它在分布式数据块上构建多个随机森林集成,并将它们合并为一个巨型集成。这种方法适用于从单个机器无法容纳的海量数据中学习。为获得最佳精度,应使用IVoting而非装袋法来生成随机森林中每棵决策树的训练子集。在两个大型数据集(压缩后5GB和50GB)上的实验表明,COMET在使用串行算法对数据子样本进行学习时,在准确率和训练时间方面均具有优势。最后,我们提出了一种新的高斯方法用于惰性集成评估,该方法动态决定每个数据点需要评估的集成成员数量;这可以将评估成本降低100倍或更多。

关键词

引用

@article{arxiv.1103.2068,
  title  = {COMET: A Recipe for Learning and Using Large Ensembles on Massive Data},
  author = {Justin D. Basilico and M. Arthur Munson and Tamara G. Kolda and Kevin R. Dixon and W. Philip Kegelmeyer},
  journal= {arXiv preprint arXiv:1103.2068},
  year   = {2013}
}