利用概率积分变换降低大数据分类问题中多路模糊决策树复杂度的方法
机器学习
2019-03-04 v1 机器学习
摘要
我们提出一种新的分布式模糊划分方法,以降低大数据分类问题中多路模糊决策树的复杂度。所提算法为所有变量构建固定数目的模糊集,并根据训练数据的真实分布调整其形状与位置。采用两步过程:1) 通过概率积分变换将原始分布转换为标准均匀分布。由于原始分布通常未知,累积分布函数通过计算机训练集的 q-分位数来近似;2) 在变换后的属性空间中,使用固定数目等距分布的三角隶属函数构建 Ruspini 强模糊划分。尽管有上述变换,每个模糊集在原始空间中的定义可通过应用逆累积分布函数(亦称分位数函数)恢复。实验结果表明,所提方法使最先进的多路模糊决策树(FMDT)归纳算法在叶子节点减少多达 600 万个的情况下保持分类精度。
引用
@article{arxiv.1903.00345,
title = {On the usage of the probability integral transform to reduce the complexity of multi-way fuzzy decision trees in Big Data classification problems},
author = {Mikel Elkano and Mikel Uriz and Humberto Bustince and Mikel Galar},
journal= {arXiv preprint arXiv:1903.00345},
year = {2019}
}
备注
Appeared in 2018 IEEE International Congress on Big Data (BigData Congress). arXiv admin note: text overlap with arXiv:1902.09357