中文

一种基于 DNA 甲基化 450K 数据对癌症组织来源进行分类的新的简约方法

组织与器官 2021-01-05 v1

摘要

DNA 甲基化是一种研究充分的遗传修饰,调控真核生物的基因转录。其改变已被认为是癌症发生的重要组成部分。本研究中,我们使用来自 The Cancer Genome Atlas 的 DNA 甲基化 450k 数据,评估 DNA 甲基化数据对 30 种癌症类型分类的效能。我们提出了一种在高维数据(超过 45 万)中进行基因选择的新方法。首先引入方差滤波进行降维,然后使用递归特征消除(RFE)进行特征选择。我们解决了从大量甲基化位点中选择小基因子集的问题,我们的简约模型被证明是高效的,准确率达 91% 以上,优于使用 DNA 微阵列和 RNA-seq 数据的其他研究。我们比较了基于 4 种估计器(随机森林、决策树、Extra Tree 和支持向量机)和 5 种分类器(k-近邻、支持向量机、XGboost、Light GBM 和多层感知机)的 20 个模型的性能,并检验了 RFE 算法的鲁棒性。结果表明,Extra Tree 加 catboost 分类器的组合模型在癌症识别中表现最佳,在 20、30、40 和 50 个特征下总体验证准确率分别为 91%、92.3%、93.3% 和 93.5%。通过富集分析探讨了 50 个选定基因在癌症发生中的生物学功能,结果显示前 16 个特征中有 12 个已被确认与癌症特异性相关,我们也提出了一些待未来研究检验的更多基因。因此,我们的方法可用作确定特定癌症实际临床病理状态的辅助诊断方法。

关键词

引用

@article{arxiv.2101.00570,
  title  = {A new parsimonious method for classifying Cancer Tissue-of-Origin Based on DNA Methylation 450K data},
  author = {Shen Jia and Yulin Zhang and Yiming Mao and Jiawei Gao and Yixuan Chen and Yuxuan Jiang and Haochen Luo and Kebo Lv and Jionglong Su},
  journal= {arXiv preprint arXiv:2101.00570},
  year   = {2021}
}

备注

39 pages