大语言模型智能体群体用于蛋白质序列设计与实验验证
人工智能
2025-12-01 v1 介观与纳米尺度物理
软凝聚态物质
计算与语言
机器学习
摘要
按需设计具有特定结构、物理化学和功能性质的蛋白质序列是生物技术、医药和材料科学中的重大挑战,由于序列空间的庞大以及序列、结构与功能之间的复杂耦合。当前最先进的生成方法,如蛋白质语言模型(PLMs)和扩散基架,往往需要大量微调、特定任务的数据或模型重新配置才能支持目标导向设计,从而限制了其灵活性和可扩展性。为克服这些限制,我们提出一种受群体智能启发的去中心化、智能体驱动的蛋白质设计框架。在此框架中,多个大语言模型(LLM)智能体并行运行,每个智能体负责特定残基位置。这些智能体整合设计目标、局部邻域相互作用以及来自前一次迭代的记忆和反馈,逐步提出具有上下文感知的突变。这种位置级、去中心化的协调机制实现了无需基于 motifs 或多个序列对齐的多样化、明确定义的序列设计,其在 α 螺旋和卷曲结构的蛋白质上经实验验证。通过分析残基保守性、基于结构的指标以及序列收敛性和嵌入,我们展示该框架展现出群体行为并有效导航蛋白质适应度景观。该方法在数小时内即可完成目标导向的高效设计,且完全无需微调或专门训练,为蛋白质设计提供了通用且可适应的解决方案。除了蛋白质之外,该方法为跨生物分子系统和其他科学发现任务中的集合 LLM 驱动的设计奠定了基础。
引用
@article{arxiv.2511.22311,
title = {Swarms of Large Language Model Agents for Protein Sequence Design with Experimental Validation},
author = {Fiona Y. Wang and Di Sheng Lee and David L. Kaplan and Markus J. Buehler},
journal= {arXiv preprint arXiv:2511.22311},
year = {2025}
}