中文

通过整合多组学数据中的数据集间与数据集内关系进行癌症亚型识别

机器学习 2023-12-06 v1 基因组学 应用统计

摘要

多组学数据的整合已成为深入了解癌症等复杂疾病的一种极具前景的方法。本文提出了一种通过整合多组学数据进行聚类以识别癌症亚型的新方法。所提出的方法名为 LIDAF,利用基于不同组学数据集之间和之内线性关系的亲和矩阵(Linear Inter and Intra Dataset Affinity Fusion,LIDAF)。本文采用典型相关分析,基于典型变量间的欧氏距离创建距离矩阵。这些距离矩阵被转换为亲和矩阵,并通过三步过程进行融合。所提出的 LIDAF 解决了现有方法的局限性,从而以 Adjusted Rand Index 和 Normalized Mutual Information score 衡量,提升了聚类性能。此外,我们提出的 LIDAF 方法在 Cox 生存分析获得的 50\% 的 log10 秩 p 值中表现出显著提升,超越了此前报告的最佳方法的性能,突显了其识别不同癌症亚型的潜力。

关键词

引用

@article{arxiv.2312.02195,
  title  = {Cancer Subtype Identification through Integrating Inter and Intra Dataset Relationships in Multi-Omics Data},
  author = {Mark Peelen and Leila Bagheriye and Johan Kwisthout},
  journal= {arXiv preprint arXiv:2312.02195},
  year   = {2023}
}