基于数据驱动阈值的集成特征选择用于阿尔茨海默病生物标志物发现
机器学习
2022-07-06 v1
摘要
医疗健康数据集对机器学习和统计学都提出了诸多挑战,因为其数据通常具有异质性、删失、高维且含有缺失信息。特征选择常用于识别重要特征,但在应用于高维数据时可能产生不稳定的结果,在每次迭代中选择不同的特征集合。特征选择集成的使用可改善特征选择的稳定性,其将多个基特征选择器的结果进行聚合。必须对最终聚合的特征集合施加阈值,以将相关特征与冗余特征分离。通常所采用的固定阈值无法保证最终选出的特征集合仅包含相关特征。本工作提出了若干数据驱动阈值,用于在集成特征选择器中自动识别相关特征,并评估其预测准确性与稳定性。为证明这些方法在临床数据上的适用性,将其应用于两项真实世界阿尔茨海默病(AD)研究的数据。AD是一种无已知治愈方法的进行性神经退行性疾病,在明显症状出现前至少2-3十年即已起病,这为研究人员识别可能预示AD患病风险的早期生物标志物提供了机会。将这些方法应用于两个数据集所识别出的特征与AD文献中的当前发现相符。
引用
@article{arxiv.2207.01822,
title = {Ensemble feature selection with data-driven thresholding for Alzheimer's disease biomarker discovery},
author = {Annette Spooner and Gelareh Mohammadi and Perminder S. Sachdev and Henry Brodaty and Arcot Sowmya},
journal= {arXiv preprint arXiv:2207.01822},
year = {2022}
}
备注
18 pages, 5 figures