S$^2$Drug:在对比式表征学习中桥接蛋白质序列与3D结构用于虚拟筛选
数据结构与算法
2025-11-11 v1 计算几何
离散数学
组合数学
摘要
虚拟筛选(VS)是药物发现中的关键任务,聚焦于识别与特定蛋白质口袋结合的小分子配体。现有深度学习方法,从早期的回归模型到最近的对比学习方法,主要依赖结构数据而忽视蛋白质序列,这些序列更易获取且可提升泛化能力。然而,直接整合蛋白质序列面临大规模蛋白质-配体数据集中冗余与噪声的挑战。为此,我们提出了\textbf{SDrug},一个两阶段框架,显式地在蛋白质-配体对比表征学习中融合蛋白质\textbf{S}equence信息和3D\textbf{S}tructure context。在第一个阶段,我们在ChemBL上进行蛋白质序列预训练,采用基于ESM2的骨干网络,结合量身定制的数据抽样策略以减少蛋白质和配体两方面的冗余与噪声。在第二个阶段,我们在PDBBind上进行微调,通过残基水平门控模块融合序列与结构信息,同时引入辅助结合位点预测任务。该辅助任务指导模型准确定位蛋白质序列中的结合残基并捕捉其3D空间布局,从而细化蛋白质-配体匹配。跨多个基准测试,SDrug持续改进虚拟筛选性能并在结合位点预测方面取得优异成绩,彰显了在对比学习中桥接序列与结构的价值。
引用
@article{arxiv.2511.07008,
title = {Revisiting Chazelle's Implementation of the Bottom-Left Heuristic: A Corrected and Rigorous Analysis},
author = {Stefan Michel},
journal= {arXiv preprint arXiv:2511.07008},
year = {2025}
}
备注
48 pages, 34 figures