利用机器学习识别乳腺癌的表观遗传标志物
基因组学
2019-10-16 v1 机器学习
机器学习
摘要
本文报道的研究识别了乳腺癌的表观遗传生物标志物(甲基化 beta 模式)。许多癌症由 DNA 中 CpG 位点异常甲基化引起的基因表达水平异常所触发。为开发致癌甲基化的早期诊断和治疗方法,有必要从 DNA 中数百万个位置里识别出几十个关键的癌症相关 CpG 甲基化位点。本研究使用公共 TCGA 数据集训练 TensorFlow 机器学习模型,基于每个样本中超过 300,000 个甲基化 beta 值对乳腺癌与非乳腺癌组织样本进行分类。应用 L1 正则化来识别对准确分类最重要的 CpG 甲基化位点。假设具有最高学习模型权重的 CpG 位点对应于与乳腺癌最相关的 DNA 位置。仅在完整模型(基于超过 300,000 个 CpG 位点的甲基化 beta 训练)中权重最高的 25 个 CpG 位点的甲基化 beta 上训练的简化模型,在评估数据上达到了超过 94% 的准确率,证实了所识别的 25 个 CpG 位点确实是乳腺癌的生物标志物。
引用
@article{arxiv.1910.06899,
title = {Identifying Epigenetic Signature of Breast Cancer with Machine Learning},
author = {Maxim Vaysburd},
journal= {arXiv preprint arXiv:1910.06899},
year = {2019}
}
备注
8 pages, 4 figures, 2 tables