中文

基于单变量与多变量特征选择混合方法的癌症分类基因选择

定量方法 2015-06-18 v1 计算工程、金融与科学 机器学习 机器学习

摘要

文献中可见各种基于微阵列数据的癌症分类基因选择方法,它们可分为两类:单变量方法和多变量方法。单变量方法孤立地看待数据中的每个基因,在不考虑其他基因存在的情况下衡量特定基因对分类的贡献。相反,多变量方法通过考虑数据中的其他基因来衡量基因对分类的相对贡献。总体而言,多变量方法选择的基因更少。然而,多变量方法的选择过程可能对无关基因的存在、表达中的噪声以及训练数据中的离群值敏感。同时,多变量方法的计算成本高。为克服两类方法的缺点,我们提出一种混合方法以获得规模小且高判别性的基因集。我们的混合方法由单变量最大似然法(LIK)和多变量递归特征消除法(RFE)构建而成。我们分析了这些方法的属性,并在两个癌症微阵列数据集上系统测试了所提方法的有效性。在白血病数据集和小型圆蓝细胞肿瘤数据集上的实验证明了混合方法的有效性。它能够发现由比文献报道更少基因组成的基因集,同时达到相同或更好的预测精度。

关键词

引用

@article{arxiv.1506.02085,
  title  = {Gene selection for cancer classification using a hybrid of univariate and multivariate feature selection methods},
  author = {Min Xu and Rudy Setiono},
  journal= {arXiv preprint arXiv:1506.02085},
  year   = {2015}
}