中文

一种用于数据离散化的最大相关最小散度准则及其在朴素贝叶斯中的应用

机器学习 2023-04-06 v2 离散数学 信息论 math.IT

摘要

在许多分类模型中,数据被离散化以更好地估计其分布。现有离散化方法往往旨在最大化离散化数据的判别力,却忽视了分类中数据离散化的主要目标是提升泛化性能。结果,由于未离散化数据保留最大判别信息,数据往往被过度划分为许多小箱。因此,我们提出最大依赖最小散度(MDmD)准则,以同时最大化离散化数据的判别信息与泛化能力。更具体地,最大依赖准则最大化离散化数据与分类变量间的统计依赖,而最小散度准则显式最小化给定离散化方案下训练数据与验证数据间的 JS 散度。所提 MDmD 准则在技术上颇具吸引力,但难以可靠估计属性与分类变量的高阶联合分布。因此我们进一步提出更实用的方案——最大相关最小散度(MRmD)离散化方案,其中每个属性被分别离散化,通过同时最大化离散化数据的判别信息与泛化能力实现。所提 MRmD 在 45 个机器学习基准数据集上、于朴素贝叶斯分类框架下与最先进离散化算法进行比较,其在大多数数据集上显著优于所有对比方法。

关键词

引用

@article{arxiv.2209.10095,
  title  = {A Max-relevance-min-divergence Criterion for Data Discretization with Applications on Naive Bayes},
  author = {Shihe Wang and Jianfeng Ren and Ruibin Bai and Yuan Yao and Xudong Jiang},
  journal= {arXiv preprint arXiv:2209.10095},
  year   = {2023}
}

备注

Under major revision of Pattern Recognition