基于基因表达的癌症患者生存预测:一种主题建模方法
机器学习
2019-11-19 v2 机器学习
摘要
癌症是全球范围内的主要死因之一。许多人认为基因组数据将使我们能够更好地预测这些患者的生存时间,从而带来更好、更个性化的治疗选择和患者护理。由于标准生存预测模型难以应对此类基因表达(GE)数据的高维性,许多研究使用一些降维技术来克服这一障碍。我们受自然语言领域主题建模的启发,引入了一种新方法,从高维GE数据中导出具有表现力的特征。在那里,一篇文档被表示为相对较少数量主题上的混合,其中每个主题对应于词上的分布;在此,为适应患者癌症的异质性,我们将每个患者(~文档)表示为癌症主题上的混合,其中每个癌症主题是GE值(~词)上的混合。这需要对标准LDA模型进行一些扩展,例如:以适应“实值”表达值——从而产生了我们新颖的“离散化”隐狄利克雷分配(dLDA)过程。我们最初关注METABRIC数据集,该数据集通过来自微阵列的r=49,576个GE值描述乳腺癌患者。我们的结果表明,就标准一致性(Concordance)度量而言,我们的方法提供的生存估计比标准模型更准确。然后我们通过在Pan-kidney(KIPAN)数据集上运行该方法进行验证,涉及r=15,529个GE值——这里使用mRNAseq模态——并发现它再次取得了优异的结果。在这两种情况下,我们还使用最近的“D-calibrated”度量表明所得模型是校准的。在两种不同癌症类型和表达模态下的这些成功,证明了该方法的通用性和有效性。
引用
@article{arxiv.1903.10536,
title = {Gene Expression based Survival Prediction for Cancer Patients: A Topic Modeling Approach},
author = {Luke Kumar and Russell Greiner},
journal= {arXiv preprint arXiv:1903.10536},
year = {2019}
}