基于结构条件分类扩散的强化学习用于蛋白质逆折叠
人工智能
2024-10-23 v1
摘要
蛋白质逆折叠——即预测能折叠成所需三维结构的氨基酸序列——是基于结构的蛋白质设计中的一个重要问题。基于机器学习的逆折叠方法通常将恢复原始序列作为优化目标。然而,逆折叠是一个“一对多”问题,其中多个序列可以折叠成相同的结构。此外,对于许多实际应用,通常希望拥有多个、多样化的能折叠成目标结构的序列,因为这为下游优化提供了更多候选序列。在这里,我们证明,尽管最近的逆折叠方法显示出更高的序列恢复率,但它们的“可折叠多样性”——即生成多个不相似但能折叠成与目标一致结构的序列的能力——并未增加。为了解决这个问题,我们提出了RL-DIF,一个用于逆折叠的分类扩散模型,该模型在序列恢复上进行预训练,并通过关于结构一致性的强化学习进行微调。我们发现RL-DIF在序列恢复和结构一致性方面与基准模型相当,但显示出更大的可折叠多样性:实验表明,在CATH 4.2上,RL-DIF可以达到29%的可折叠多样性,而使用相同数据集训练的模型为23%。PyTorch模型权重和采样代码可在GitHub上获取。
引用
@article{arxiv.2410.17173,
title = {Reinforcement learning on structure-conditioned categorical diffusion for protein inverse folding},
author = {Yasha Ektefaie and Olivia Viessmann and Siddharth Narayanan and Drew Dresser and J. Mark Kim and Armen Mkrtchyan},
journal= {arXiv preprint arXiv:2410.17173},
year = {2024}
}