大型语言模型能否预测抗菌药抗性基因?
计算与语言
2025-03-07 v1
摘要
本研究表明,生成式大型语言模型可以更灵活的方式用于DNA序列分析和分类任务,与传统基于转换器编码器的模型相比。尽管最近的基于编码器的模型如DNABERT和Nucleotide Transformer 在DNA序列分类方面显示出显著性能,但基于转换器解码器的生成式模型在该领域尚未得到广泛探索。本研究评估了生成式大型语言模型在处理带有各种标签的DNA序列时的效果,并分析了在提供额外文本信息时性能的变化情况。实验在抗菌药抗性基因上进行,结果表明,生成式大型语言模型可提供可比或潜在更好的预测,显示出在纳入序列和文本信息时灵活性和准确性。本工作使用的代码和数据可在以下GitHub仓库获取:https://github.com/biocomgit/llm4dna。
引用
@article{arxiv.2503.04413,
title = {Can Large Language Models Predict Antimicrobial Resistance Gene?},
author = {Hyunwoo Yoo},
journal= {arXiv preprint arXiv:2503.04413},
year = {2025}
}