中文

快速且鲁棒的特征选择:自编码器节能稀疏训练的优势

机器学习 2021-09-14 v2 机器学习

摘要

近期高维数据量的增长带来了主要难题,包括高计算成本与内存需求。特征选择通过识别数据集中最相关和最具信息量的属性,被提出作为该问题的解决方案。现有大多数特征选择方法计算效率低下;低效的算法导致高能耗,这对于计算和能源资源受限的设备并不可取。本文提出一种新颖且灵活的无监督特征选择方法。该方法名为 QuickSelection,将稀疏神经网络中神经元的重要性作为衡量特征重要性的准则。该准则与采用稀疏演化训练过程训练的稀疏连接去噪自编码器相结合,可同时推导出所有输入特征的重要性。我们以纯粹的稀疏方式实现 QuickSelection,而非使用连接上的二值掩码来模拟稀疏性的典型做法。这带来了显著的速度提升与内存缩减。在包括五个低维和三个高维数据集的若干基准数据集上测试时,所提方法在分类与聚类准确率、运行时间和最大内存使用之间取得了广泛使用特征选择方法中的最佳权衡。此外,我们的方法在基于自编码器的先进特征选择方法中能耗最低。

关键词

引用

@article{arxiv.2012.00560,
  title  = {Quick and Robust Feature Selection: the Strength of Energy-efficient Sparse Training for Autoencoders},
  author = {Zahra Atashgahi and Ghada Sokar and Tim van der Lee and Elena Mocanu and Decebal Constantin Mocanu and Raymond Veldhuis and Mykola Pechenizkiy},
  journal= {arXiv preprint arXiv:2012.00560},
  year   = {2021}
}

备注

29 pages