一种简单的数据离散化器
机器学习
2017-10-17 v1 数据库
机器学习
摘要
数据离散化是机器学习过程中的重要步骤,因为分类器处理离散属性比处理连续属性更容易。多年来,人们提出、探索并实施了几种执行离散化的方法,如布尔推理、等频分箱和熵法。在本文中,介绍了一种简单的监督离散化方法。MIL 的主要目标是在连续属性离散化时最大化分类器的分类准确率,同时最小化信息损失。使用最先进的规则归纳算法 J48(C4.5 分类器的 Java 实现),将所建议方法的性能与监督离散化算法最小信息损失(MIL)进行了比较。所提出的方法确实是 MIL 的修改版本。实证结果表明,与原 MIL 算法和最小描述长度原则(MDLP)相比,修改后的方法在多种情况下表现更好。
引用
@article{arxiv.1710.05091,
title = {A simple data discretizer},
author = {Gourab Mitra and Shashidhar Sundareisan and Bikash Kanti Sarkar},
journal= {arXiv preprint arXiv:1710.05091},
year = {2017}
}