UMAP 辅助的 K-means 聚类用于大规模 SARS-CoV-2 突变数据集
定量方法
2021-01-01 v1
摘要
由严重急性呼吸综合征冠状病毒 2 (SARS-CoV-2) 引起的 2019 冠状病毒病 (COVID-19) 在全球造成了破坏性影响。理解 SARS-CoV-2 的进化与传播对 COVID-19 的管控、抗击和预防至关重要。由于 SARS-CoV-2 基因组序列数量与独特突变数量的快速增长,SARS-CoV-2 基因组分离株的系统发育分析面临紧迫的大数据挑战。我们引入一种降维的 k-means 聚类策略以应对该挑战。我们考察了三种降维算法的性能与有效性:主成分分析 (PCA)、t 分布随机邻域嵌入 (t-SNE) 和一致流形逼近与投影 (UMAP)。通过使用四个基准数据集,我们发现 UMAP 是最适宜的技术,因其稳定、可靠且高效的性能,其提升聚类精度的能力(尤其对基于大 Jaccard 距离的数据集),以及其优越的聚类可视化。UMAP 辅助的 k-means 聚类使我们能够洞察来自 SARS-CoV-2 基因组分离株的日益增长的大规模数据集。
引用
@article{arxiv.2012.15268,
title = {UMAP-assisted $K$-means clustering of large-scale SARS-CoV-2 mutation datasets},
author = {Yuta Hozumi and Rui Wang and Changchuan Yin and Guo-Wei Wei},
journal= {arXiv preprint arXiv:2012.15268},
year = {2021}
}
备注
30 pages, 10 figures