中文

用于药物发现中模块化任务执行的大语言模型代理

机器学习 2025-12-15 v3 计算与语言 生物大分子

摘要

我们提出了一个由大语言模型(LLM)驱动的模块化框架,自动化并简化了早期计算药物发现管道中的关键任务。通过将LLM推理与特定领域工具结合,该框架执行生物医学数据检索、基于检索增强生成的文献依据问答、分子生成、多属性预测、属性感知的分子细化和3D蛋白-配体结构生成。该代理自主检索相关生物分子信息,包括FASTA序列、SMILES表示和文献,并通过改进的上下文准确性来回答机制性问题。随后生成化学上多样的初始分子并预测75种属性,包括ADMET相关和一般物理化学描述符,这些属性指导迭代分子细化。在两轮细化后,QED>0.6的分子数量从34个增加到55个。符合经验药物活性过滤器的分子数量也随之上升;例如,遵循Ghose过滤器的合规性在100个分子的池中从32个提高到55个。该框架还运用Boltz-2生成3D蛋白-配体复合物并为候选化合物提供快速结合亲和力估计。这些结果表明,该方法有效支持分子筛选、优先级排序和结构评估。其模块化设计使能够灵活集成不断演化的工具和模型,为AI辅助疗法发现提供了可扩展的基础。

关键词

引用

@article{arxiv.2507.02925,
  title  = {Large Language Model Agent for Modular Task Execution in Drug Discovery},
  author = {Janghoon Ock and Radheesh Sharma Meda and Srivathsan Badrinarayanan and Neha S. Aluru and Achuth Chandrasekhar and Amir Barati Farimani},
  journal= {arXiv preprint arXiv:2507.02925},
  year   = {2025}
}