使用 FolDE 实现低-N 蛋白活性优化
机器学习
2025-10-29 v1 定量方法
摘要
蛋白传统上通过昂贵的构建和测量大量突变体来进行优化。活性学习辅助的有向进化(ALDE)通过预测最佳改进并迭代测试突变体来缓解此成本。然而,现有 ALDE 方法面临一个关键局限:在每个周期中选择最高预测的突变体会产生同质化的训练数据,不足以准确预测后续周期中的结果。本文提出 FolDE,一种旨在最大化 campaign 末期成功的 ALDE 方法。在 20 个蛋白靶点上的仿真实验中,FolDE 比最佳基线 ALDE 方法发现更多 20% 以上的前 10% 突变体(p=0.005),且更有可能发现前 1% 突变体(提升 55%)。FolDE 主要通过自然性基准启动实现这一目标,该方法利用蛋白语言模型的输出来改进活动预测。我们还引入一种常数说谎 batch 选择器,提高了 batch 的多样性;这在多突变 campaign 中至关重要,但在我们的基准测试中效果有限。该完整工作流程作为开源软件提供,使任何实验室都能高效进行蛋白优化。
引用
@article{arxiv.2510.24053,
title = {Low-N Protein Activity Optimization with FolDE},
author = {Jacob B. Roberts and Catherine R. Ji and Isaac Donnell and Thomas D. Young and Allison N. Pearson and Graham A. Hudson and Leah S. Keiser and Mia Wesselkamper and Peter H. Winegar and Janik Ludwig and Sarah H. Klass and Isha V. Sheth and Ezechinyere C. Ukabiala and Maria C. T. Astolfi and Benjamin Eysenbach and Jay D. Keasling},
journal= {arXiv preprint arXiv:2510.24053},
year = {2025}
}
备注
18 pages, 4 figures. Preprint. Open-source software available at https://github.com/JBEI/foldy