中文

用于药物发现的 RAG 增强协作 LLM 智能体

机器学习 2025-11-17 v3 人工智能

摘要

大型语言模型(LLM)的最新进展显示出加速药物发现的巨大潜力。然而,生化数据的专业性质通常需要昂贵的领域特定微调,这构成了重大挑战。首先,它阻碍了更灵活的通用 LLM 应用于前沿药物发现任务。更重要的是,它限制了快速整合通过实验和研究不断产生的大量科学数据。使这些挑战更加复杂的是,现实世界的科学问题通常复杂且开放,需要超越模式匹配或静态知识检索的推理。为了应对这些挑战,我们提出了 CLADD,一个为药物发现任务量身定制的检索增强生成(RAG)赋能智能体系统。通过多个 LLM 智能体的协作,CLADD 从生物医学知识库中动态检索信息,将查询分子置于上下文中,并整合相关证据以生成响应——所有这些都无需领域特定微调。至关重要的是,我们解决了将 RAG 工作流应用于生化数据的关键障碍,包括数据异构性、模糊性和多源整合。我们在各种药物发现任务中展示了该框架的灵活性和有效性,表明它优于通用和领域特定 LLM 以及传统深度学习方法。我们的代码已在 https://github.com/Genentech/CLADD 公开。

关键词

引用

@article{arxiv.2502.17506,
  title  = {RAG-Enhanced Collaborative LLM Agents for Drug Discovery},
  author = {Namkyeong Lee and Edward De Brouwer and Ehsan Hajiramezanali and Tommaso Biancalani and Chanyoung Park and Gabriele Scalia},
  journal= {arXiv preprint arXiv:2502.17506},
  year   = {2025}
}

备注

Machine Learning, Drug Discovery