中文

面向骨质疏松症药物发现中多组学数据集生物标志物筛选的鲁棒核机器回归

机器学习 2022-01-14 v1 机器学习 统计方法学

摘要

许多统计机器学习方法可通过分析多组学数据最终揭示复杂疾病病因的新特征。然而,当观测样本可能被对抗性损坏离群值(例如虚构数据分布)污染时,它们对分布中的一些偏差敏感。同样,统计进展滞后于支持复杂多组学数据整合的综合性数据驱动分析。我们提出一种基于非线性M估计量的新方法“鲁棒核机器回归(RobKMR)”,以改进统计机器回归的鲁棒性以及虚构数据的多样性,从而检验多组学数据集的高阶复合效应。我们处理一个鲁棒核中心Gram矩阵以准确估计模型参数。我们还提出一种鲁棒得分检验来评估多组学数据特征的边际与联合Hadamard积。我们将所提方法应用于来自高加索女性的骨质疏松症(OP)多组学数据集。实验表明,该方法有效识别了OP的相互关联风险因素。凭借坚实证据(p值 = 0.00001)、生物验证、基于网络的分析、因果推断与药物重定位,所选三个三元组((DKK1, SMTN, DRGX)、(MTND5, FASTKD2, CSMD3)、(MTND5, COG3, CSMD3))是显著生物标志物并直接与BMD相关。总体而言,排名前三的所选基因(DKK1、MTND5、FASTKD2)和一个基因(SIDT1,p值=0.001)在30个OP药物重定位候选中显著结合四种药物——他克莫司、伊班膦酸盐、阿仑膦酸盐和巴多昔芬。此外,所提方法可应用于任何有多组学数据集可用的疾病模型。

关键词

引用

@article{arxiv.2201.05060,
  title  = {A robust kernel machine regression towards biomarker selection in multi-omics datasets of osteoporosis for drug discovery},
  author = {Md Ashad Alam and Hui Shen and Hong-Wen Deng},
  journal= {arXiv preprint arXiv:2201.05060},
  year   = {2022}
}

备注

19 pages, 10 figures