中文

通过提升独特相关性改进基于互信息的特征选择

机器学习 2022-12-20 v2 人工智能

摘要

基于互信息(MI)的特征选择利用 MI 评估每个特征并最终筛选出相关特征子集,以解决高维数据集相关问题。尽管 MI 在特征选择中有效,我们注意到许多最先进算法忽视了所谓的特征独特相关性(UR),从而得到包含不可忽略数量冗余特征的次优所选特征子集。我们指出,问题的核心在于所有这些 MIBFS 算法遵循最大化相关性最小冗余性(MRwMR)准则,其并未显式针对 UR。这促使我们用提升独特相关性(BUR)目标来增强现有准则,得到称为 MRwMR-BUR 的新准则。根据所解决问题的不同,MRwMR-BUR 有两种变体,称为 MRwMR-BUR-KSG 与 MRwMR-BUR-CLF,它们以不同方式估计 UR。MRwMR-BUR-KSG 通过称为 KSG 估计器的基于最近邻的方法估计 UR,并为三大主要任务设计:(i)分类性能。(ii)特征可解释性。(iii)分类器泛化。MRwMR-BUR-CLF 通过基于分类器的方法估计 UR。它使 UR 适应不同分类器,进一步提升 MRwMR-BUR 面向分类性能任务的竞争力。MRwMR-BUR-KSG 与 MRwMR-BUR-CLF 的性能通过使用六个公开数据集与三种流行分类器的实验得到验证。具体而言,与 MRwMR 相比,所提 MRwMR-BUR-KSG 在所选特征减少 25% - 30% 的情况下将测试准确率提升 2% - 3%,且不增加算法复杂度。MRwMR-BUR-CLF 进一步将分类性能提升 3.8% - 5.5%(相对于 MRwMR),并且也优于三种流行的依赖分类器的特征选择方法。

关键词

引用

@article{arxiv.2212.06143,
  title  = {Improving Mutual Information based Feature Selection by Boosting Unique Relevance},
  author = {Shiyu Liu and Mehul Motani},
  journal= {arXiv preprint arXiv:2212.06143},
  year   = {2022}
}

备注

13 pages