中文

基于最近邻的网络模型评估COVID-19序列数据

机器学习 2022-11-23 v2 生物大分子

摘要

SARS-CoV-2冠状病毒是人类COVID-19疾病的病原。像许多冠状病毒一样,它可适应不同宿主并演化出不同谱系。众所周知,主要SARS-CoV-2谱系的特征是突变主要发生于刺突蛋白。理解刺突蛋白结构及其受扰动的方式,对于理解和判定某一谱系是否值得关注至关重要。这些对于识别和控制当前疫情及预防未来大流行至关重要。鉴于可用测序数据海量,其中大量未比对甚至未组装,机器学习(ML)方法是此项工作的可行方案。然而,此类ML方法需要欧氏空间中的定长数值特征向量才适用。类似地,在处理生物序列的分类与聚类任务时,欧氏空间并非最佳选择。为此,我们设计一种将蛋白(刺突)序列转换为序列相似性网络(SSN)的方法。随后可将SSN作为图挖掘领域经典算法的输入,用于分类与聚类等典型任务以理解数据。我们表明,所提出的无比对方法在聚类结果上能够优于当前SOTA方法。类似地,使用知名的基于Node2Vec的嵌入相比其他基线嵌入方法能获得更高分类精度。

关键词

引用

@article{arxiv.2211.10546,
  title  = {Evaluating COVID-19 Sequence Data Using Nearest-Neighbors Based Network Model},
  author = {Sarwan Ali},
  journal= {arXiv preprint arXiv:2211.10546},
  year   = {2022}
}

备注

Accepted at IEEE BigData 2022