利用大型语言模型进行酶俱反应预测与表征
人工智能
2025-05-12 v1 机器学习
生物大分子
摘要
酶俱反应的预测对于生物催化、代谢工程和药物发现等应用至关重要,但仍是一项复杂且资源密集的任务。大型语言模型(LLM)最近在 various 科学领域展现出惊人的成功,如其能够对复杂结构进行泛化推理,并利用情境学习策略。本研究系统评估了LLM(特别是Llama-3.1系列(8B和70B))在三个核心生化任务中的能力:酶系编号预测、正向合成和逆向合成。我们比较了单任务和多任务学习策略,采用LoRA适配器进行参数高效微调。此外,我们评估了不同数据规模下的性能,以探索其在低数据情境下的适应性。我们的结果表明,微调后的LLM能够捕捉生化知识,多任务学习通过利用共享的酶俱信息显著提升正向和逆向合成预测。我们还识别出了关键局限性,例如在层次化酶系分类方案中的挑战,凸显了LLM驱动的生化建模在进一步改进方面的研究方向。
引用
@article{arxiv.2505.05616,
title = {Leveraging Large Language Models for enzymatic reaction prediction and characterization},
author = {Lorenzo Di Fruscia and Jana Marie Weber},
journal= {arXiv preprint arXiv:2505.05616},
year = {2025}
}