中文

基于逐步SVM的高维数据集降维

应用统计 2017-11-10 v1 机器学习

摘要

本研究提出一种降维方法——逐步支持向量机(SVM),以对大p小n数据集进行降维。利用五个基因表达数据集,将所提方法与其它降维方法进行比较,即皮尔逊积差相关系数(PCCs)、基于随机森林的递归特征消除(RF-RFE)与主成分分析(PCA)。此外,评估了由本方法所选变量的预测性能。研究发现逐步SVM能有效选择重要变量并取得良好预测性能。而且,逐步SVM对降维后数据集的预测优于未降维数据集。逐步SVM的性能比PCA与RF-RFE更稳定,但与PCCs的性能差异极小。对大p小n数据集进行降维是必要的。我们相信逐步SVM能有效消除数据中的噪声,并提升任意大p小n数据集中的预测精度。

关键词

引用

@article{arxiv.1711.03346,
  title  = {Dimension Reduction of High-Dimensional Datasets Based on Stepwise SVM},
  author = {Elizabeth P. Chou and Tzu-Wei Ko},
  journal= {arXiv preprint arXiv:1711.03346},
  year   = {2017}
}