中文

一种基于扰动理论的特征选择方法

机器学习 2019-02-27 v1 机器学习

摘要

考虑一个监督数据集 D=[Ab]D=[A\mid \textbf{b}],其中 b\textbf{b} 为结果列,DD 的行对应观测值,AA 的列对应数据集的特征。机器学习与模式识别中的一个核心问题是从 DD 中选择最重要的特征以预测结果。本文提出一种新的特征选择方法,利用扰动理论检测特征间的相关性。我们通过最小二乘法与 AA 的奇异值分解求解 AX=bAX=\textbf{b}。在实际应用中,例如生物信息学中,AA 的行数(观测值)远小于 AA 的列数(特征)。因此我们处理的是具有大条件数的奇异矩阵。尽管已知奇异情况下最小二乘问题的解对 AA 中的扰动非常敏感,本文的新颖之处在于证明通过对 AA 施加扰动可检测特征间的相关性。通过与文献中常规及新颖的特征选择方法进行一系列比较,验证了本方法的有效性。结果表明,在大多数情况下,本方法所选特征数量显著更少,同时达到或超过其他方法的精度。

关键词

引用

@article{arxiv.1902.09938,
  title  = {A Feature Selection Based on Perturbation Theory},
  author = {Javad Rahimipour Anaraki and Hamid Usefi},
  journal= {arXiv preprint arXiv:1902.09938},
  year   = {2019}
}