中文

基于独特相关信息特征选择的医疗健康数据方法

机器学习 2018-12-04 v1 机器学习

摘要

特征选择旨在从观测数据中搜索最具代表性的特征,对医疗健康数据分析至关重要。与基于 PCA 和自编码器等特征提取方法不同,特征选择保留了可解释性,即所选特征提供关于特定健康状况(即标签)的直接信息。因此,特征选择使临床医生等领域专家能够理解基于机器学习的系统所做的预测,并提升自身的诊断技能。互信息常作为特征选择的基础,因其度量特征与标签之间的依赖关系。本文提出一种新颖的基于互信息的特征选择(MIBFS)方法 SURI,其提升具有高独特相关信息(unique relevant information)的特征。我们在 6 个公开医疗数据集上使用 3 种不同分类器将 SURI 与现有 MIBFS 方法比较。结果表明,除保留可解释性外,SURI 选出更相关的特征子集,从而获得更高的分类性能。更重要的是,我们通过穷举搜索在公开低维健康数据集上探究互信息的动态特性。结果揭示了独特相关信息在特征选择中的重要作用,并验证了 SURI 背后的原理。

关键词

引用

@article{arxiv.1812.00415,
  title  = {Feature Selection Based on Unique Relevant Information for Health Data},
  author = {Shiyu Liu and Mehul Motani},
  journal= {arXiv preprint arXiv:1812.00415},
  year   = {2018}
}

备注

Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216