构建一种有竞争力的关联分类器
机器学习
2020-07-07 v1 机器学习
摘要
随着深度学习的巨大成功,其他机器学习范式不得不退居次要地位。然而其他模型,特别是基于规则的模型,具有更好的可读性和可解释性,并且在标注数据不充足时甚至具有竞争力。然而,大多数现有基于规则的分类器存在产生大量分类规则的问题,影响了模型可读性。这损害了分类精度,因为噪声规则可能不提供任何有用的分类信息,并导致更长的分类时间。在本研究中,我们提出 SigD2,其使用一种新颖的两阶段剪枝策略,剪除大多数噪声、冗余和无趣的规则,使分类模型更准确且可读。为使 SigDirect 与最流行但不可解释的基于机器学习的分类器(如神经网络和支持向量机)更具竞争力,我们提出在 SigDirect 分类器集成上采用 bagging 和 boosting。所提算法的结果相当可观,我们能够在不影响分类精度的前提下获得一组极小的统计显著分类规则。我们使用 15 个 UCI 数据集,并将我们的方法与八种现有系统比较。SigD2 和 boosted SigDirect(ACboost)集成模型不仅在分类精度上,而且在规则数量上都优于各种最先进的分类器。
引用
@article{arxiv.2007.01972,
title = {Building a Competitive Associative Classifier},
author = {Nitakshi Sood and Osmar Zaiane},
journal= {arXiv preprint arXiv:2007.01972},
year = {2020}
}
备注
To be published in - The 22nd International Conference on Big Data Analytics and Knowledge Discovery - DaWaK2020, Bratislava, Slovakia, September 14-17, 2020