中文

一种简单的数据离散化器

机器学习 2017-10-17 v1 数据库 机器学习

摘要

数据离散化是机器学习过程中的重要步骤,因为分类器处理离散属性比处理连续属性更容易。多年来,人们提出、探索并实施了几种执行离散化的方法,如布尔推理、等频分箱和熵法。在本文中,介绍了一种简单的监督离散化方法。MIL 的主要目标是在连续属性离散化时最大化分类器的分类准确率,同时最小化信息损失。使用最先进的规则归纳算法 J48(C4.5 分类器的 Java 实现),将所建议方法的性能与监督离散化算法最小信息损失(MIL)进行了比较。所提出的方法确实是 MIL 的修改版本。实证结果表明,与原 MIL 算法和最小描述长度原则(MDLP)相比,修改后的方法在多种情况下表现更好。

关键词

引用

@article{arxiv.1710.05091,
  title  = {A simple data discretizer},
  author = {Gourab Mitra and Shashidhar Sundareisan and Bikash Kanti Sarkar},
  journal= {arXiv preprint arXiv:1710.05091},
  year   = {2017}
}