一种基于遗传算法与数据重要性重格式化的新型机器学习分类器
机器学习
2024-12-19 v1 人工智能
神经与进化计算
摘要
本文提出了一种基于数据重要性(DI)重格式化和遗传算法(GA)的新型分类算法,命名为 GADIC,以克服可能阻碍机器学习(ML)分类器性能的数据性质相关问题。GADIC 包含三个阶段:依赖于 DI 概念的数据重格式化阶段;在重格式化训练数据集上应用 GA 的训练阶段;以及在测试阶段根据训练数据集中的相似实例对重格式化测试数据集的实例进行平均的测试阶段。GADIC 是一种利用现有 ML 分类器并引入数据重格式化的方法,使用 GA 调整输入,并对未知实例的相似实例进行平均。在测试阶段,实例的平均值即成为待分类的未知实例。GADIC 已在五种现有 ML 分类器上进行了测试,分别是支持向量机(SVM)、K近邻(KNN)、逻辑回归(LR)、决策树(DT)和朴素贝叶斯(NB)。所有分类器均使用七个开源 UCI ML 仓库和 Kaggle 数据集进行评估,分别为克利夫兰心脏病、印度肝病患者、皮马印第安人糖尿病、员工未来预测、电信流失预测、银行客户流失和科技学生。在准确性方面,结果表明,除了 NB 分类器在克利夫兰心脏病数据集上的准确性下降约 1% 外,GADIC 显著提升了大多数 ML 分类器在各种数据集上的性能。此外,与其他结合 GADIC 的 ML 分类器相比,结合 GADIC 的 KNN 表现出最大的性能提升,其次是 SVM,而 LR 的提升幅度最小。GADIC 能够实现的最低平均提升为 5.96%,而最高平均提升达到 16.79%。
引用
@article{arxiv.2412.13350,
title = {A Novel Machine Learning Classifier Based on Genetic Algorithms and Data Importance Reformatting},
author = {A. K. Alkhayyata and N. M. Hewahi},
journal= {arXiv preprint arXiv:2412.13350},
year = {2024}
}