中文

利用大语言模型预测环境元数据中的微生物本体及致病风险

计算与语言 2025-07-30 v1

摘要

传统机器学习模型在微生物组研究中难以从仅含元数据的情境下推广,尤其在小样本或跨研究标签格式异质的情境下尤为如此。本文探讨使用大语言模型(LLM)对微生物样本分类至本体类别(如 EMPO 3)及相关生物标签,以及仅使用环境元数据预测致病污染风险(具体指大肠杆菌是否存在)。我们评估了 ChatGPT-4o、Claude 3.7 Sonnet、Grok-3 和 LLaMA 4 等 LLM 在零-shot 和 few-shot 设置下的表现,并将其与像随机森林等传统模型在多个真实数据集上进行比较。我们的结果表明,LLM 不仅在本体分类中超越基线模型,还在跨站点和元数据分布 generalization 方面展现出强大的致病风险预测能力。这一发现表明,LLM 能够有效地对稀疏且异质的生物学环境元数据进行推理,为环境微生物学和生物监测应用提供了一种可行的仅使用元数据的方案。

关键词

引用

@article{arxiv.2507.21980,
  title  = {Predicting Microbial Ontology and Pathogen Risk from Environmental Metadata with Large Language Models},
  author = {Hyunwoo Yoo and Gail L. Rosen},
  journal= {arXiv preprint arXiv:2507.21980},
  year   = {2025}
}