层次收缩:提升基于树的方法的准确性与可解释性
机器学习
2022-02-03 v1 人工智能
应用统计
统计方法学
机器学习
摘要
决策树与随机森林(RF)等基于树的模型是现代机器学习实践的基石。为缓解过拟合,树通常通过修改其结构的一系列技术(例如剪枝)进行正则化。我们引入层次收缩(HS),这是一种不改树结构、而是通过将对每个节点的预测向其祖先的样本均值收缩来正则化树的事后算法。收缩量由单一正则化参数及每个祖先中的数据点数量控制。由于 HS 是事后方法,它极其快速、与任何树生长算法兼容,且可与其他正则化技术协同使用。在大量真实世界数据集上的广泛实验表明,HS 显著提升了决策树的预测性能,即使与其他正则化技术结合使用也是如此。此外,我们发现将 HS 应用于 RF 中的每棵树常能提升准确性,并通过简化和稳定其决策边界与 SHAP 值来提升其可解释性。我们进一步通过展示 HS 等价于在由与树内部节点相关的决策桩构成的(有监督)基上的岭回归,解释了 HS 提升预测性能的成功原因。所有代码与模型均已发布于 Github 上的完整软件包中(github.com/csinva/imodels)。
引用
@article{arxiv.2202.00858,
title = {Hierarchical Shrinkage: improving the accuracy and interpretability of tree-based methods},
author = {Abhineet Agarwal and Yan Shuo Tan and Omer Ronen and Chandan Singh and Bin Yu},
journal= {arXiv preprint arXiv:2202.00858},
year = {2022}
}