中文

基于 Spark 迁移策略的可扩展特征子集选择并行双目标进化算法

分布式、并行与集群计算 2022-05-20 v1

摘要

用于分类的特征子集选择(FSS)本质上是一个双目标优化问题,其任务是获得一个特征子集,在以最小特征子集基数下产生接收者操作特征曲线下面积(AUC)的最大可能值。当今世界中,人类所有活动均产生海量数据。为挖掘此类常为高维的海量数据,有必要开发并行且可扩展的框架。在一项首创性研究中,我们提出并开发了基于迭代 MapReduce 的双目标进化算法(EAs)包装器框架,运行于 Apache Spark 之上并采用迁移策略。为此,我们将基于非支配排序的算法即非支配排序遗传算法(NSGA-II)与非支配排序粒子群优化(NSPSO),以及基于分解的算法即基于分解的多目标进化算法(MOEA-D)并行化,并分别命名为 P-NSGA-II-IS、P-NSPSO-IS、P-MOEA-D-IS。我们通过在并行化时融入非支配排序原理改进了 MOEA-D。整个研究中,AUC 由逻辑回归(LR)计算。我们在多个数据集上测试了所提方法的有效性。值得注意的是,P-NSGA-II 在大多数数据集上稳居前 2 名,具有统计显著性。我们还给出了经验达成图、加速比分析,以及由出现次数最多的特征子集与具有最高 AUC 的最小基数特征子集所得的平均 AUC,并使用超体积进行了多样性分析。

关键词

引用

@article{arxiv.2205.09465,
  title  = {Parallel bi-objective evolutionary algorithms for scalable feature subset selection via migration strategy under Spark},
  author = {Yelleti Vivek and Vadlamani Ravi and P. Radha Krishna},
  journal= {arXiv preprint arXiv:2205.09465},
  year   = {2022}
}

备注

32 pages, 11 Tables, 8 figures