中文

PathoLM:通过基因组基础模型从DNA序列识别病原性

计算与语言 2024-06-21 v1 机器学习 基因组学

摘要

病原体识别在疾病的诊断、治疗和预防中至关重要,对于控制感染和维护公共卫生至关重要。传统的基于比对的方法虽然被广泛使用,但计算强度大且依赖庞大的参考数据库,并且由于灵敏度和特异性低,常常无法检测到新型病原体。同样,传统的机器学习技术虽然前景广阔,但需要大量标注数据集和广泛的特征工程,并且容易过拟合。为应对这些挑战,我们引入了PathoLM,这是一个尖端的病原体语言模型,针对细菌和病毒序列的病原性识别进行了优化。利用预训练DNA模型(如Nucleotide Transformer)的优势,PathoLM只需最少的数据即可进行微调,从而增强了病原体检测能力。它有效地捕获了更广泛的基因组背景,显著改进了对新型和差异较大的病原体的识别。我们开发了一个包含约30种病毒和细菌物种的综合数据集,包括ESKAPEE病原体,以及七种对抗生素具有耐药性的高毒力细菌菌株。此外,我们还专门针对ESKAPEE组整理了一个物种分类数据集。在比较评估中,PathoLM显著优于DciPatho等现有模型,展现出强大的零样本和少样本能力。此外,我们将PathoLM扩展为PathoLM-Sp用于ESKAPEE物种分类,尽管任务复杂,但它仍表现出优于其他先进深度学习方法的性能。

关键词

引用

@article{arxiv.2406.13133,
  title  = {PathoLM: Identifying pathogenicity from the DNA sequence through the Genome Foundation Model},
  author = {Sajib Acharjee Dip and Uddip Acharjee Shuvo and Tran Chau and Haoqiu Song and Petra Choi and Xuan Wang and Liqing Zhang},
  journal= {arXiv preprint arXiv:2406.13133},
  year   = {2024}
}

备注

9 pages, 3 figures