用于 '组学数据集整合一致性聚类的多核学习
机器学习
2020-08-05 v4 机器学习
应用统计
统计方法学
摘要
多种应用——尤其在肿瘤分型中——已证明了整合聚类技术对于结合多个数据源信息的重要性。聚类之聚类分析(COCA)就是这样一种在肿瘤分型背景下被广泛采用的方法。然而,COCA 的性质从未被系统探究,且其对于含噪声数据集或定义冲突聚类结构的数据集的鲁棒性尚不清楚。我们严格地对 COCA 进行基准测试,并提出核学习整合聚类(KLIC)作为一种替代策略。KLIC 将结合聚类结构的挑战构建为一个多核学习问题,其中不同数据集各自对最终聚类提供加权贡献。这使得噪声数据集的贡献相对于信息量更大的数据集被调低。我们通过模拟研究在多种情形下比较 KLIC 与 COCA 的性能。我们还展示了 KLIC 和 COCA 在癌症分型和转录模块发现真实数据应用中的输出。R 包 “klic” 和 “coca” 可在 Comprehensive R Archive Network 上获取。
引用
@article{arxiv.1904.07701,
title = {Multiple kernel learning for integrative consensus clustering of 'omic datasets},
author = {Alessandra Cabassi and Paul D. W. Kirk},
journal= {arXiv preprint arXiv:1904.07701},
year = {2020}
}
备注
Manuscript: 18 pages, 6 figures. Supplement: 29 pages, 19 figures. This version contains additional simulation studies and comparisons to other methods. For associated R code, see https://CRAN.R-project.org/package=klic and https://github.com/acabassi/klic-pancancer-analysis