中文

面向无人口抗病毒药物发现的开源工具基准测试

生物大分子 2026-05-07 v1 定量方法

摘要

抗病毒药物因能在新 outbreak 期间快速部署,尤其是从已批准药物中进行的药物再利用,处于独特有利位置。然而,绝大多数具有流行病潜力的病毒家族尚无FDA批准的抗病毒药。本文阐述了投资于抗病毒药物发现技术与方法,以及设计抗病毒药物组合的理由,并present了一项关于无人口抗病毒药物发现的开源数据集与计算工具的调查,特别关注最新的AI-based系统与对接工具。随后,我们呈现了一个来自BindingDB等来源精选的43005组病毒蛋白-配体结合测量的定制数据集。重要的是,我们发现BindingDB中31%的病毒蛋白结合数据在用于训练或测试机器学习模型之前,需要仔细拆分蛋白酶序列。使用我们的定制数据集,我们对DrugFormDTA结合亲和力预测模型(Khokhlov等2025)进行了微调。随后,我们在853种抗病毒化合物(跨10种病毒物种、16种蛋白靶点)的定制测试集上,对15个开源结合亲和力预测工具进行基准测试。所测试的模型包括Boltz-2、GNINA、FlowDock、Interformer、AutoDock-GPU等。我们发现Boltz-2和DrugFormDTA在基于机器学习的方法中综合排名最高,GNINA在对接方法中表现最佳,不同病毒蛋白之间存在显著差异。对DrugFormDTA在定制清洗抗病毒数据集上的微调将性能从r=0.5r=0.5提升至r=0.7r=0.7。本工作还编译了一个批准药物图书馆以及一份详尽的 investigational 和批准抗病毒药物清单,可在https://antivirals-database.radvac.org查看。总体而言,本工作为未来工作奠定了基础,旨在开发用于快速药物再利用和快速设计抗病毒药物组合的新工具与平台。

关键词

引用

@article{arxiv.2605.04265,
  title  = {Benchmarking open-source tools for in silico antiviral drug discovery},
  author = {Daniel C. Elton and Preston W. Estep},
  journal= {arXiv preprint arXiv:2605.04265},
  year   = {2026}
}

备注

60 pages, 9 figures, 13 tables