有效且可扩展的 SARS-CoV-2 序列聚类方法
种群与进化
2021-10-13 v5 机器学习
摘要
SARS-CoV-2 与其他病毒一样,在传播过程中根据进化过程持续突变。但与其他病毒不同的是,GISAID 等公共数据库中当前可用的 SARS-CoV-2 序列数量已达数百万。如此大量的数据有潜力前所未有地揭示病毒的进化动态。然而,百万级数据量已远超传统用于重建病毒进化史方法(如构建系统发育树的方法)所能处理的范围数个数量级。因此,需要设计新的可扩展方法,以利用不断增加的病毒序列数据。由于识别变异株是理解病毒进化的重要部分,本文提出一种基于序列聚类的方法来识别当前主要的 SARS-CoV-2 变异株。利用基于 -mer 的特征向量生成与高效特征选择方法,我们的方法能有效识别变异株,且对数百万序列高效且可扩展。这种聚类方法使我们能展示各变异株随时间的相对比例,给出不同地点各变异株的传播速率——这对疫苗研发与分配十分重要。我们还根据信息增益计算了刺突蛋白各氨基酸位置在识别特定变异株中的重要性。具有高变异株特异性重要性的位置往往与美国疾病控制与预防中心(CDC)所报道的一致,进一步证明了我们的方法。
引用
@article{arxiv.2108.08143,
title = {Effective and scalable clustering of SARS-CoV-2 sequences},
author = {Sarwan Ali and Tamkanat-E-Ali and Muhammad Asad Khan and Imdadullah Khan and Murray Patterson},
journal= {arXiv preprint arXiv:2108.08143},
year = {2021}
}
备注
To Appear in: International Conference on Big Data Research (ICBDR)