中文

一种量化特征选择与排序算法稳定性的信息论方法

机器学习 2024-02-09 v1 人工智能

摘要

特征选择是处理高维数据的关键步骤。特别是,这些技术通过从噪声、冗余和不相关特征中选择最相关的特征,简化了从数据中发现知识的过程。在许多实际应用中遇到的一个问题是,特征选择算法的结果不稳定。因此,数据的微小变化可能导致截然不同的特征排序。在上述情况下,评估这些方法的稳定性成为一个重要问题。我们提出了一种基于Jensen-Shannon散度的信息论方法来量化这种稳健性。与其他稳定性度量不同,该度量适用于不同的算法输出:完全排序列表、特征子集以及研究较少的偏序列表。这种广义度量量化了一组相同大小列表之间的差异,遵循概率方法,并能够对列表顶部出现的不一致赋予更高的重要性。此外,它还具有理想的属性,包括对变化的校正、上下界以及确定性选择的条件。我们使用完全受控生成的数据展示了该稳定性度量的用法,并将其与流行的度量(如特征排序和选择结果上的Spearman秩相关系数和Kuncheva指数)进行了比较。此外,在一个食品质量评估的实际问题上对所提方法进行了实验验证,展示了其从不同角度量化稳定性的潜力。

关键词

引用

@article{arxiv.2402.05295,
  title  = {An information theoretic approach to quantify the stability of feature selection and ranking algorithms},
  author = {Alaiz-Rodriguez and R. and Parnell and A. C},
  journal= {arXiv preprint arXiv:2402.05295},
  year   = {2024}
}