依据对维度灾难的韧性进行特征选择
机器学习
2023-04-18 v2
摘要
现实世界的数据集往往具有高维性并受维度灾难影响,这妨碍了其可理解性与可解释性。为降低复杂性,特征选择旨在识别对从所述数据中学习至关重要的特征。虽然相关性和两两相似性的度量常被使用,但维度灾难很少被纳入特征选择过程。在此我们提出一种新方法,识别那些能够区分不同大小数据子集的特征。通过改编近期关于计算本征维数的工作,我们的方法能够选择可区分数据从而削弱维度灾难的特征。我们的实验表明该方法具有竞争力,且通常优于既有的特征选择方法。此外,我们提出了一种近似方法,使我们的方法可扩展到包含数百万数据点的数据集。我们的发现表明,能够区分数据且与低本征维数相关联的特征对学习过程是有意义的。
引用
@article{arxiv.2304.02455,
title = {Selecting Features by their Resilience to the Curse of Dimensionality},
author = {Maximilian Stubbemann and Tobias Hille and Tom Hanika},
journal= {arXiv preprint arXiv:2304.02455},
year = {2023}
}
备注
16 pages, 1 figure, 2 tables