中文

基于地理位置的 SARS-CoV-2 刺突序列表征

机器学习 2022-10-14 v4 定量方法

摘要

随着 COVID-19 在全球的快速传播,病毒基因组数据在 GISAID 等公共数据库上以百万级序列的规模可用。这一大数据为当前大流行病的有效疫苗研发以及避免或减轻未来大流行病的研究分析提供了独特机遇。每条此类病毒序列都附带其采集的地理位置信息——病毒变体与地理位置之间发现的模式无疑是该分析的重要组成部分。研究人员面临的一大挑战是处理如此庞大、高维的数据以尽快获得有用洞察。现有多数方法在处理该规模数据时面临可扩展性问题。本文提出一种方法,首先使用 kk-mers(子串)计算 SARS-CoV-2 刺突蛋白序列的数值表示,然后使用若干机器学习模型基于地理位置对序列进行分类。我们表明所提模型显著优于基线方法。我们还通过计算对应于真实类标签的信息增益,展示了刺突序列中不同氨基酸的重要性。

关键词

引用

@article{arxiv.2110.00809,
  title  = {Characterizing SARS-CoV-2 Spike Sequences Based on Geographical Location},
  author = {Sarwan Ali and Babatunde Bello and Zahra Tayebi and Murray Patterson},
  journal= {arXiv preprint arXiv:2110.00809},
  year   = {2022}
}

备注

Accepted at Journal of Computational Biology (JCB)