用于从高维数据中进行特征选择的新型 GPU Boruta 算法
机器学习
2026-05-12 v1 人工智能
摘要
大多数特征选择算法,尤其是包装器方法,由于其计算复杂度高,在基于 CPU 的平台上运行效率低下。这种低效性使其不适合处理大规模数据集。为了应对这一挑战,本研究提出了 Boruta 特征选择过程的两个 GPU 加速版本,其中 Boruta-Permut 依赖于基于置换的特征重要性,而 Boruta-TreeImp 采用基于不纯度降低的重要性。为了评估这些方法,我们在一个自构建的数据集和几个公开可用的数据集上进行了实验。实验结果表明,所提出的 GPU 加速算法在保持与原始 Boruta 算法相当的特征选择准确性的同时,极大地提高了计算效率。在我们的分析中,我们还观察到基于不纯度降低的版本可能会高估某些特征的重要性。总体而言,这些发现表明在 GPU 上执行 Boruta 特征选择为大规模数据分析提供了一种有效且高性价比的解决方案,非常划算。
引用
@article{arxiv.2605.09950,
title = {Novel GPU Boruta algorithms for feature selection from high-dimensional data},
author = {Xurui Li and Zhiguo Gan and Jiaming Zhang and Zheng Liu and Diannan Lu},
journal= {arXiv preprint arXiv:2605.09950},
year = {2026}
}
备注
This paper has been submitted to the journal Data Mining and Knowledge Discovery, and a preprint is available for the authors' records