高维数据集中特征选择的(不)重要性
机器学习
2025-09-22 v2 基因组学
机器学习
摘要
特征选择(FS)被假设为提高高维数据集的预测性能并识别有意义的特征。令人惊讶的是,来自28个不同数据集(包括microarray、bulk 和 single-cell RNA-Seq、质谱、成像等)的小型随机特征子集(0.02-1%)的表现不输于完整特征集和FS。简而言之,任何任意的特征子集都与任何其他子集一样好(结果方差也异常小)——那么,如何才能说某一特定的特征子集是"重要"的,既然它们与任意子集的表现无异呢?这些结果挑战了计算选择特征可靠地捕获有意义信号的假设,强调在解读所选特征作为可操作特征之前的严格验证的重要性,尤其是在计算生物学中。
引用
@article{arxiv.2508.03593,
title = {On the (In)Significance of Feature Selection in High-Dimensional Datasets},
author = {Bhavesh Neekhra and Debayan Gupta and Partha Pratim Chakrabarti},
journal= {arXiv preprint arXiv:2508.03593},
year = {2025}
}
备注
(review in progress). supplementary material included in pdf; anonymized code at: https://anonymous.4open.science/r/Feature_Selection_HD-D853/README.md