中文

通过结构感知方法将虚拟筛选扩展至数十亿分子规模:SPRINT

生物大分子 2025-01-22 v2 机器学习

摘要

小分子对蛋白靶点的虚拟筛选可通过预测药物-靶点相互作用(DTIs)加速药物发现与开发。然而,基于结构的方法如分子对接速度过慢,难以进行大规模的蛋白组尺度筛选,限制了其在筛查非靶标效应或新分子机制方面的应用。最近,基于向量的方法使用蛋白语言模型(PLMs)作为一种绕过显式三维结构建模的补充方法。本文发展了SPRINT(Structure-Aware Protein Language Model for Virtual Screening),一种用于筛查整个化学库对整个蛋白组以进行DTIs和新机制活性的向量方法。SPRINT通过采用基于自注意力的架构和结构感知PLMs来学习药物-靶点共嵌入,用于结合预测、搜索和检索。SPRINT在LIT-PCBA、DTIs分类基准和结合亲和力预测基准上实现了SOTA检索因子,同时以残基水平注意力图形式提供可解释性。除了在准确性和可解释性方面表现优异外,SPRINT还极快:查询整个人类蛋白组对ENAMINE真实数据库(67亿药物)以每个蛋白筛选最可能的100个结合剂仅需16分钟。SPRINT有望在前所未有的规模上实现虚拟筛选,为无网药物再定位和开发开辟了新的机遇。SPRINT已作为ColabScreen在网上提供:https://bit.ly/colab-screen

关键词

引用

@article{arxiv.2411.15418,
  title  = {Scaling Structure Aware Virtual Screening to Billions of Molecules with SPRINT},
  author = {Andrew T. McNutt and Abhinav K. Adduri and Caleb N. Ellington and Monica T. Dayao and Eric P. Xing and Hosein Mohimani and David R. Koes},
  journal= {arXiv preprint arXiv:2411.15418},
  year   = {2025}
}