中文

通过规则提取实现可解释的随机森林

机器学习 2021-02-11 v4 人工智能 机器学习

摘要

我们提出 SIRUS(Stable and Interpretable RUle Set,稳定可解释规则集)用于回归,这是一种稳定的规则学习算法,形式为简短而简单的规则列表。最先进的学习算法常被称为“黑箱”,因其预测过程涉及大量运算。尽管它们具有强大的预测能力,但这种可解释性的缺乏对涉及关键决策的应用可能是高度受限的。另一方面,结构简单的算法——典型如决策树、规则算法或稀疏线性模型——以其不稳定性著称。这一不良特性使数据分析结论不可靠,并构成严重的操作限制。这促使了 SIRUS 的设计,其结合了简单结构与在数据扰动下显著稳定的行为,且保留了随机森林的预测精度。我们基于随机森林设计算法。我们通过实验和理论(证明其渐近稳定性)证明了该方法的有效性。我们的 R/C++ 软件实现 sirus 可从 CRAN 获取。

关键词

引用

@article{arxiv.2004.14841,
  title  = {Interpretable Random Forests via Rule Extraction},
  author = {Clément Bénard and Gérard Biau and Sébastien da Veiga and Erwan Scornet},
  journal= {arXiv preprint arXiv:2004.14841},
  year   = {2021}
}