理解乳腺癌生存:在多组学数据上运用因果发现与语言模型
机器学习
2023-05-31 v1 计算与语言
基因组学
统计方法学
摘要
医疗领域对更可用且可解释的机器学习模型的需求,提升了开发和利用因果发现算法的重要性,此类算法旨在通过分析观测数据发现因果关系。可解释的方法有助于临床医生和生物学家预测疾病预后并建议恰当治疗。然而,在因果发现、基因组学与乳腺癌的交叉点上研究极少,我们旨在弥补这一空白。此外,在真实数据上评估因果发现方法通常极为困难,因为真实因果关系往往未知;相应地,本文还提出利用大语言模型解决该评估问题。具体地,我们采用合适的因果发现算法研究基因组中的各类扰动如何影响乳腺癌确诊患者的生存。我们使用了三种主要因果发现算法:PC、贪婪等价搜索(GES)以及一种基于广义精度矩阵的方法。我们在The Cancer Genome Atlas的一个子集上实验,该子集包含705名乳腺癌患者的突变、拷贝数变异、蛋白水平与基因表达信息。我们的发现利用因果发现算法揭示了与患者生命状态相关的重要因素。然而,这些结果的可靠性在医学领域仍存疑。因此,作为本工作的另一贡献,结果通过基于生物医学文献训练的语言模型(如BlueBERT及其他在医学语料上训练的大语言模型)进行验证。我们的结果表明,恰当地运用因果发现算法与语言模型可揭示用于临床应用的可靠因果关系。
引用
@article{arxiv.2305.18410,
title = {Understanding Breast Cancer Survival: Using Causality and Language Models on Multi-omics Data},
author = {Mugariya Farooq and Shahad Hardan and Aigerim Zhumbhayeva and Yujia Zheng and Preslav Nakov and Kun Zhang},
journal= {arXiv preprint arXiv:2305.18410},
year = {2023}
}