中文

稳健表示与高效特征选择实现 SARS-CoV-2 变异株的有效聚类

机器学习 2021-10-20 v1 定量方法

摘要

COVID-19 大流行导致大量 SARS-CoV-2 病毒基因组数据的广泛可得,为研究人员提供了前所未有的细节水平来分析该疾病,这是以往任何病毒都不曾有的。一方面,这将帮助生物学家、政策制定者和其他权威机构及时做出适当决策以控制冠状病毒传播。另一方面,此类研究将有助于更有效地应对未来任何可能的大流行。由于 SARS-CoV-2 病毒包含不同变异株,各自具有不同突变,对此类数据执行任何分析都成为一项困难任务。众所周知,SARS-CoV-2 基因组中的大部分变异不成比例地发生在基因组序列的刺突区域——即编码刺突蛋白的相对较短的区域。因此,在本文中,我们提出一种对刺突蛋白序列进行聚类的方法,以研究在全球以极高速度增长的不同已知变异株的行为。我们使用基于 k-mers 的方法首先为刺突序列生成固定长度的特征向量表示。然后我们表明,通过适当的特征选择,我们可以基于不同变异株对刺突序列进行高效且有效的聚类。使用公开可用的 SARS-CoV-2 刺突序列集,我们使用硬聚类和软聚类方法对这些序列进行聚类,并表明借助我们的特征选择方法,我们可以为聚类取得更高的 F1 分数。

关键词

引用

@article{arxiv.2110.09622,
  title  = {Robust Representation and Efficient Feature Selection Allows for Effective Clustering of SARS-CoV-2 Variants},
  author = {Zahra Tayebi and Sarwan Ali and Murray Patterson},
  journal= {arXiv preprint arXiv:2110.09622},
  year   = {2021}
}