用因果建模提升机器学习识别生物标志物的泛化性:适应性免疫受体诊断探究
定量方法
2023-04-04 v2 机器学习
摘要
机器学习正日益被用于从高维分子数据中发现诊断与预后生物标志物。然而,与实验设计相关的多种因素可能影响学习到具泛化性与临床适用性的诊断方法的能力。在此,我们认为因果视角可改进对这些挑战的识别,并形式化其与基于机器学习的诊断之鲁棒性与泛化性的关系。为展开具体讨论,我们聚焦于一个特定的、近期建立的高维生物标志物——适应性免疫受体库(AIRRs)。通过仿真,我们阐明 AIRR 领域的主要生物学与实验因素如何可能影响所学得的生物标志物。总之,我们认为因果建模通过识别变量间的稳定关系,并指导调整群体间变化的那些关系与变量,从而提升基于机器学习的生物标志物鲁棒性。
引用
@article{arxiv.2204.09291,
title = {Improving generalization of machine learning-identified biomarkers with causal modeling: an investigation into immune receptor diagnostics},
author = {Milena Pavlović and Ghadi S. Al Hajj and Chakravarthi Kanduri and Johan Pensar and Mollie Wood and Ludvig M. Sollid and Victor Greiff and Geir Kjetil Sandve},
journal= {arXiv preprint arXiv:2204.09291},
year = {2023}
}