中文

用于识别癌症驱动因子的大型 DNA 甲基化数据集分类

基因组学 2018-04-16 v1 计算工程、金融与科学

摘要

DNA 甲基化是一种研究充分的遗传修饰,对调控基因组功能至关重要。其改变在肿瘤发生和肿瘤抑制中发挥重要作用。因此,研究 DNA 甲基化数据有助于癌症中的生物标志物发现。由于公共 DNA 甲基化数据变得丰富,并且考虑到基因组中存在大量甲基化位点(特征),拥有一种高效处理此类大型数据集的方法十分重要。依托大数据技术,我们提出 BIGBIOCL 算法,该算法可将监督分类方法应用于具有数十万特征的数据集。它设计用于通过迭代删除所选特征来提取替代和等效分类模型。我们在从癌症基因组图谱提取的 DNA 甲基化数据集上运行实验,聚焦于三种肿瘤类型:乳腺、肾脏和甲状腺 carcinoma。我们进行分类,提取多个甲基化位点及其相关基因,并取得了准确的性能。结果表明,BIGBIOCL 可在几小时内对数十万特征执行数百次分类迭代。此外,我们将我们的方法与其他最先进的分类器以及一种基于网络分析的广泛使用的 DNA 甲基化分析方法进行比较。最后,我们能够有效计算多个替代分类模型,并从 DNA 甲基化大型数据集中提取一组候选基因,以进一步研究其在癌症中的积极作用。BIGBIOCL、实验结果以及进行新实验的指南可在 GitHub 上免费获取。

关键词

引用

@article{arxiv.1804.04839,
  title  = {Classification of large DNA methylation datasets for identifying cancer drivers},
  author = {Fabrizio Celli and Fabio Cumbo and Emanuel Weitschek},
  journal= {arXiv preprint arXiv:1804.04839},
  year   = {2018}
}