中文

随机森林的无损(与有损)压缩

机器学习 2018-10-29 v1 机器学习

摘要

集成方法是最先进(SOTA)的预测建模方法之一。应用于现代大数据时,这些方法通常需要大量的子学习器,且每个学习器的复杂度通常随数据集规模增长。这一现象导致对存储空间的日益增长的需求,这可能非常昂贵。该问题主要在基于订阅的环境中显现,其中用户特定的集成需存储在具有严格存储限制(如蜂窝设备)的个人设备上。在本文中,我们引入了一种用于基于树的集成方法(聚焦随机森林)无损压缩的新方法。我们建议的方法基于对集成中树的概率建模,随后通过 Bregman 散度进行模型聚类。这使我们能找到一组极小的模型,既准确描述树,又足够小以便存储与维护。我们的压缩方案在多种现代数据集上展示了高压缩率。重要的是,我们的方案支持从压缩格式进行预测,并能完美重建原始集成。此外,我们引入了一种理论上有据的有损压缩方案,使我们能控制失真与编码率之间的权衡。

关键词

引用

@article{arxiv.1810.11197,
  title  = {Lossless (and Lossy) Compression of Random Forests},
  author = {Amichai Painsky and Saharon Rosset},
  journal= {arXiv preprint arXiv:1810.11197},
  year   = {2018}
}