面向不平衡数据的深度稀疏自编码器集成特征选择
机器学习
2021-03-23 v1 机器学习
摘要
类别不平衡是学习算法许多领域应用中的常见问题。通常,在同一领域中,正确分类和刻画少数类样本更为重要。这一需求可通过特征选择(FS)来解决,其特征选择还带来若干进一步优势,如降低计算成本、辅助推断与可解释性。然而,传统 FS 技术在强不平衡数据下可能变得次优。为在此情形下获得 FS 的优势,我们提出一种过滤式 FS 算法,基于深度稀疏自编码器集成(DSAEE)的重建误差对特征重要性排序。我们使用仅在多数类上训练的每一个 DSAE 来重建两个类别。从聚合重建误差的分析中,我们确定少数类相对于过度代表的类别呈现不同值分布的特征,从而识别出区分两者的最相关特征。我们在多个不同样本量的高维数据集上的若干实验中实证展示了我们算法的有效性,展现了其选择相关且可泛化特征以刻画和分类少数类的能力,优于其他基准 FS 方法。我们还简要介绍了一个放射基因组学中的实际应用,该方法已成功应用。
引用
@article{arxiv.2103.11678,
title = {Feature Selection for Imbalanced Data with Deep Sparse Autoencoders Ensemble},
author = {Michela C. Massi and Francesca Ieva and Francesca Gasperoni and Anna Maria Paganoni},
journal= {arXiv preprint arXiv:2103.11678},
year = {2021}
}