中文

为分类数据学习可证明最优的规则列表

机器学习 2018-08-07 v4 机器学习

摘要

我们提出了一种定制离散优化技术的设计与实现,用于在分类特征空间上构建规则列表。我们的算法根据正则化经验风险生成具有最优训练性能的规则列表,并附有最优性证书。通过利用算法边界、高效数据结构和计算重用,我们在时间上实现了数个数量级的加速,并大幅降低了内存消耗。我们证明我们的方法能在数秒内对实际问题生成最优规则列表。我们的结果表明,可以构建最优的稀疏规则列表,其在佛罗里达州布劳沃德县数据上的准确度与COMPAS专有风险预测工具相近,但完全可解释。该框架是CART及其他决策树方法用于可解释建模的新替代方案。

关键词

引用

@article{arxiv.1704.01701,
  title  = {Learning Certifiably Optimal Rule Lists for Categorical Data},
  author = {Elaine Angelino and Nicholas Larus-Stone and Daniel Alabi and Margo Seltzer and Cynthia Rudin},
  journal= {arXiv preprint arXiv:1704.01701},
  year   = {2018}
}

备注

A short version of this work appeared in KDD '17 as "Learning Certifiably Optimal Rule Lists"