用于癌症特征信号的 *K-means 与聚类模型
基因组学
2017-10-05 v4 定量方法
统计金融
摘要
我们通过将 https://ssrn.com/abstract=2802753 中应用于定量金融的统计聚类方法进行扩展,提出了 *K-means 聚类算法及其源代码。*K-means 在无需指定初始中心等条件下具有统计确定性。我们将 *K-means 应用于在不使用非负矩阵分解(NMF)的情况下从基因组数据中提取癌症特征信号。*K-means 的计算成本仅为 NMF 的一小部分。利用 14 种癌症类型的 1,389 个已发表样本,我们发现 3 种癌症(肝癌、肺癌和肾细胞癌)表现突出且不具有类簇结构。有两个聚类与其他 11 种癌症具有特别高的簇内相关性,表明它们具有共同的底层结构。我们的方法为研究此类结构开辟了一条新途径。*K-means 具有通用性,可应用于其他领域。我们讨论了其在定量金融中的一些潜在应用。
引用
@article{arxiv.1703.00703,
title = {*K-means and Cluster Models for Cancer Signatures},
author = {Zura Kakushadze and Willie Yu},
journal= {arXiv preprint arXiv:1703.00703},
year = {2017}
}
备注
124 pages, 69 figures; a trivial typo corrected; to appear in Biomolecular Detection and Quantification