中文

基于可分离性与一致性的模糊决策系统级联双阶段特征聚类与选择

机器学习 2024-07-24 v1 人工智能

摘要

特征选择是机器学习中的一种关键技术,可降低计算复杂度、提高模型性能并缓解过拟合风险。然而,数据集日益复杂和高维化带来的挑战,使得特征选择面临重大困难。针对这些挑战,本文提出了一种用于模糊决策系统的级联双阶段特征聚类与选择算法。在第一阶段,我们通过聚类相关特征并解决特征间的冗余问题来缩小搜索空间。在第二阶段,本文提出一种基于聚类的顺序前向选择方法,探索数据的全局与局部结构。我们提出了一种新型指标,用于评估特征的重要性,该指标同时考虑全局可分性和局部一致性。全局可分性基于模糊成员数衡量类内团聚度和类间分离度,提供了数据可分性的全面理解。而局部一致性则利用模糊邻域粗糙集模型捕捉数据中的不确定性和模糊性。通过在18个公开数据集和一个真实的精神分裂症数据集上进行实验评估,我们的方法在分类准确率和所选特征数量方面均优于基准算法。

关键词

引用

@article{arxiv.2407.15893,
  title  = {Cascaded two-stage feature clustering and selection via separability and consistency in fuzzy decision systems},
  author = {Yuepeng Chen and Weiping Ding and Hengrong Ju and Jiashuang Huang and Tao Yin},
  journal= {arXiv preprint arXiv:2407.15893},
  year   = {2024}
}

备注

This paper has been accepted by IEEE Transactions on Fuzzy Systems for publication. Permission from IEEE must be obtained for all other uses, in any current or future media. The final version is available at [10.1109/TFUZZ.2024.3420963]