中文

使用大型语言模型预测抗菌素耐药性

计算与语言 2024-01-02 v1

摘要

在抗生素耐药性不断增加以及 COVID-19 等传染病蔓延的时期,对抗生素耐药性相关基因进行分类非常重要。随着基于 Transformer 的语言模型推动了自然语言处理的进步,许多学习核苷酸序列特征的语言模型也应运而生。这些模型在分类核苷酸序列的各种特征方面表现出良好的性能。在对核苷酸序列进行分类时,不仅利用了序列本身,还利用了各种背景知识。在本研究中,我们不仅使用基于核苷酸序列的语言模型,还使用基于 PubMed 文章的文本语言模型,以便在模型中反映更多的生物学背景知识。我们提出了一种基于各种抗生素耐药基因数据库对核苷酸序列语言模型和文本语言模型进行微调的方法。我们还提出了一种基于 LLM 的数据增强技术以补充数据,以及一种有效结合这两个模型的集成方法。我们还提出了一个用于评估模型的基准。我们的方法在耐药类别预测中取得了优于核苷酸序列语言模型的性能。

关键词

引用

@article{arxiv.2401.00642,
  title  = {Predicting Anti-microbial Resistance using Large Language Models},
  author = {Hyunwoo Yoo and Bahrad Sokhansanj and James R. Brown and Gail Rosen},
  journal= {arXiv preprint arXiv:2401.00642},
  year   = {2024}
}