中文

相关高维 RNA-Seq 癌症数据集成特征选择的分析

基因组学 2020-04-30 v1 机器学习 机器学习

摘要

诊断与预后分子标志物的发现是癌症研究中重要且活跃的领域。对于复杂疾病,此过程常借助机器学习完成。本研究比较了两种相关变量发现方法:应用单一特征选择算法, versus 应用多种不同算法的集成。这些方法用于利用来自癌症基因组图谱的 RNA-seq 表达谱识别可区分四种癌症类型的相关变量。比较从两个方向展开:评估模型的预测性能并监测所选变量的稳定性。最具信息量的特征通过使用四种特征选择算法识别,即 U 检验、ReliefF 以及 MDFS 算法的两种变体。区分正常与肿瘤组织使用随机森林算法。当使用 U 检验时,特征集的稳定性最高。遗憾的是,基于集成特征选择算法所得特征集构建的模型并不优于基于单个算法所得特征集开发的模型。另一方面,导致最佳分类结果的特征选择器因数据集而异。

关键词

引用

@article{arxiv.2004.13809,
  title  = {Analysis of ensemble feature selection for correlated high-dimensional RNA-Seq cancer data},
  author = {Aneta Polewko-Klim and Witold R. Rudnicki},
  journal= {arXiv preprint arXiv:2004.13809},
  year   = {2020}
}

备注

14 pages, 1 table, 29 figure, submitted to International Conference on Computational Science, Amsterdam 2020