中文

KGroups:一种用于高维生物数据的单变量最大相关最小冗余特征选择算法

机器学习 2026-03-31 v1 人工智能

摘要

本文提出了一种新的单变量滤波特征选择(FFS)算法,称为 KGroups。文献中大多数工作集中于探讨特征选择(FS)方法的相关性或冗余性估计,这些方法已显示出有前景的成果,并显著改进了 FFS 方法的预测性能。然而,针对 alternative FFS algorithm 的探索工作有限。这引出了一个问题:FFS 方法的预测性能依赖于选择算法本身,还是取决于相关性或冗余性估计?大多数 FFS 方法分为两类:相关性最大化(Max-Rel,也称为 KBest)或相关性最大化和冗余性最小化同时实现(mRMR)。KBest 是一种单变量 FFS 方法,采用降序排序进行选择。mRMR 是一种多变量 FFS 方法,采用递增搜索算法进行选择。本文提出一种称为 KGroups 的新型单变量 mRMR 方法,采用聚类进行选择。在 14 个高维生物学基准数据集上进行的广泛实验表明,KGroups 在预测性能方面与多变量 mRMR 相似,却快达821倍。KGroups 可参数化,这为通过微调超参数进一步提高预测性能留下了空间,与 mRMR 和 KBest 不同。KGroups 在性能上优于 KBest。

关键词

引用

@article{arxiv.2603.28417,
  title  = {KGroups: A Versatile Univariate Max-Relevance Min-Redundancy Feature Selection Algorithm for High-dimensional Biological Data},
  author = {Malick Ebiele and Malika Bendechache and Rob Brennan},
  journal= {arXiv preprint arXiv:2603.28417},
  year   = {2026}
}