中文

一种用于发现整合性癌症亚型的 Interpretable 多核学习方法

机器学习 2018-11-21 v1 机器学习 应用统计

摘要

由于癌症的复杂性,聚类算法已被用于厘清观测到的异质性并识别可特异性治疗的癌症亚型。虽然基于核的聚类方法允许使用多个输入矩阵(在考量像癌症这样的多维疾病时这是一个重要因素),聚类结果仍难以评估,且在许多情况下不清楚哪部分信息对最终结果产生了何种影响。本文提出一种多核学习聚类的扩展,能够基于对结果影响最大的特征来刻画每个识别出的患者簇。为此,我们将特征聚类与多核降维相结合,并引入 FIPPA——一种衡量特征簇对患者簇影响的分数。结果:我们将该方法应用于由四种不同数据类型描述的不同癌症类型,旨在识别整合性患者亚型并理解对其识别最重要的特征。结果显示,根据标准度量(如生存分析)我们的方法不仅具有 SOTA 性能,而且基于高影响特征,它还对亚型的分子基础给出了有意义的解释。这可为潜在癌症亚型的验证提供重要一步,并有助于针对个体患者群体提出新假设。类似分析也适用于其他疾表型。

关键词

引用

@article{arxiv.1811.08102,
  title  = {An interpretable multiple kernel learning approach for the discovery of integrative cancer subtypes},
  author = {Nora K. Speicher and Nico Pfeifer},
  journal= {arXiv preprint arXiv:1811.08102},
  year   = {2018}
}