ProteinZero:基于在线强化学习的自我提升蛋白质生成
机器学习
2026-03-03 v3 定量方法
摘要
蛋白质生成模型已展现出巨大的潜力,但其成功率仍受限于依赖精选的序列-结构数据集,以及监督目标与实际设计目标之间的错位。我们提出ProteinZero,一种用于逆向折叠模型的在线强化学习框架,实现可扩展、自动化和持续的自我提升,同时具备计算效率。ProteinZero采用一种奖励管道,结合来自 ESMFold 的结构引导与一种新颖的自导 ddG 预测器,提供稳定的多目标信号,同时避免物理方法的沉重成本。为确保在线RL的鲁棒性,我们进一步引入一种嵌入级别的多样性正则化器,以缓解模式崩溃并促进功能上有意义的序列变异。在多奖励优化、参考模型的 KL 散度以及多样性正则化的通用RL公式中,ProteinZero 在设计可塑性、稳定性、恢复性和多样性方面实现了鲁棒性提升。在CATH-4.3基准上,它持续优于包括 ProteinMPNN、ESM-IF 和 InstructPLM 在内的领先基线方法,通过降低设计失败率36%-48%,在多样化折叠中实现90%以上的成功率。重要的是,一轮完整的RL运行可在单个8 X GPU节点内在三天内完成,包括奖励计算和数据生成。这些结果表明,高效的在线RL微调可补充监督预训练,使蛋白质生成模型能够从自身输出中持续演化,并在无标签数据的情况下优化多个设计目标,为探索广阔的蛋白质设计空间开辟了新的可能性。完整的源代码和模型检查点将在出版后发布。
引用
@article{arxiv.2506.07459,
title = {ProteinZero: Self-Improving Protein Generation via Online Reinforcement Learning},
author = {Ziwen Wang and Jiajun Fan and Ruihan Guo and Thao Nguyen and Heng Ji and Ge Liu},
journal= {arXiv preprint arXiv:2506.07459},
year = {2026}
}