中文

基于联合混合模型的多组学数据集成差分分析:idiffomix

统计方法学 2024-12-24 v1

摘要

基因表达和 DNA 甲基化是两种相互关联的生物过程,理解它们之间的关系对于推进包括疾病发生、环境适应、发育生物学和治疗反应等领域的理解至关重要。差分分析,包括在两种条件(如健康样本和受影响样本)之间识别差异甲基化胞嘧啶-嘌呤仿数 (CpG) 位点(DMCs)和差分表达基因(DEGs),可有助于理解生物过程和疾病进展。通常,基因表达和 DNA 甲基化数据是独立分析的,以识别 DMCs 和 DEGs,然后进一步分析两者之间的关系。此类方法忽略了这些相关数据中固有的依赖性和生物学结构。提出了联合混合模型,将两种数据类型的信息在建模阶段集成以捕获其固有的依赖结构,使能够同时识别 DMCs 和 DEGs。该模型利用联合似然函数考虑数据中的嵌套结构,并采用期望最大化算法进行参数估计。通过详尽的仿真研究和应用于公开的乳腺癌数据集评估了所提出方法 idiffomix 的性能。在数据类型独立建模时未被识别为差分表达的多个基因,在将关联甲基化数据集成到分析中后,具有很高的差分表达概率。idiffomix 方法凸显了通过联合混合模型进行集成分析相对于独立分析两种数据类型的优势;同时利用了基因组水平和跨组学信息,提供了更全面的视角。

关键词

引用

@article{arxiv.2412.17511,
  title  = {Integrated differential analysis of multi-omics data using a joint mixture model: idiffomix},
  author = {Koyel Majumdar and Florence Jaffrézic and Andrea Rau and Isobel Claire Gormley and Thomas Brendan Murphy},
  journal= {arXiv preprint arXiv:2412.17511},
  year   = {2024}
}

备注

29 pages 6 figures