基于潜在结构分词和扩散变换器的高效蛋白背骼设计
机器学习
2026-02-09 v1 人工智能
摘要
去核蛋白背骼设计的生成模型已取得显著成功,创造出新颖的蛋白质结构。然而,这些基于扩散的方法仍计算密集,速度不够理想以满足大规模结构探索的需求。虽然近期努力如 Proteina 引入流匹配以提高采样效率,但结构分词的潜在压缩和加速潜力在蛋白质领域仍鲜有探索。本文提出了 SaDiT,一种新框架,通过将 SaProt 分词与扩散变换器(DiT)架构集成来加速蛋白背骼生成。SaDiT 利用离散潜在空间表示蛋白几何结构,显著降低了生成过程的复杂性,同时保持理论的 SE(3) 等价性。为进一步提高效率,我们引入了 IPA Token 缓存机制,通过在迭代采样期间复用计算得到的 token 状态来优化 Invariant Point Attention(IPA)层。实验结果表明,SaDiT 在计算速度和结构可行性方面均优于最先进的模型,包括 RFDiffusion 和 Proteina。在无条件背骼生成和二级类条件生成任务中,SaDiT 显示出在捕捉复杂拓扑特征方面具有更好的设计能力。
引用
@article{arxiv.2602.06706,
title = {SaDiT: Efficient Protein Backbone Design via Latent Structural Tokenization and Diffusion Transformers},
author = {Shentong Mo and Lanqing Li},
journal= {arXiv preprint arXiv:2602.06706},
year = {2026}
}