可扩展的 mRMR 特征选择以应对高维数据集:基于垂直划分的迭代 MapReduce 框架
分布式、并行与集群计算
2024-07-25 v2
摘要
在构建机器学习模型时,特征选择(FS)作为处理数据中不确定性与模糊性的重要预处理步骤而脱颖而出。近来,最小冗余最大相关(mRMR)方法被证明在获取无冗余特征子集方面行之有效。鉴于海量数据集的产生,利用分布式/并行范式设计可扩展方案至关重要。MapReduce 方案被证明是设计容错且可扩展方案的最佳途径之一。本文分析了现有的 mRMR 特征选择 MapReduce 方法并指出其局限。在当前研究中,我们提出了 VMR_mRMR,一种基于垂直划分并采用记忆化方法的高效方法,从而克服了现有方法的局限。实验分析表明,VMR_mRMR 显著优于现有方法并取得了更好的计算增益(C.G)。此外,我们还与水平划分方法 HMR_mRMR [1] 进行了对比分析,以评估所提方法的优势与局限。
引用
@article{arxiv.2208.09901,
title = {Scalable mRMR feature selection to handle high dimensional datasets: Vertical partitioning based Iterative MapReduce framework},
author = {Yelleti Vivek and P. S. V. S. Sai Prasad},
journal= {arXiv preprint arXiv:2208.09901},
year = {2024}
}
备注
20 pages, 3 Figures, 5 Tables