APEX:面向超大型组合合成图书馆的近似-穷举搜索
机器学习
2025-10-29 v1
摘要
按需组合合成图书馆(CSLs)如Enamine REAL显著推动了药物发现进程。然而,其庞大规模对虚拟筛选构成挑战——后者旨在根据计算目标(如优化结合能)在有限计算预算下识别图书馆中排名靠前的化合物。在当前规模为数十亿分子的图书馆中,常规虚拟筛选可能仅能对少于0.1%的可用化合物进行评分,导致大量高分子化合物可能被遗漏。此外,随着约束条件(有时目标也变更)在虚拟筛选过程中变化,现有算法在 amortized 方面几乎没有优化空间。我们提出近似-穷举搜索协议(APEX)。APEX利用神经网络代理模型,利用CSL的结构特征预测目标与约束,使在消费级GPU上完成全枚举成为可能(<1分钟),从而实现对近似前k名集合的精确检索。为展示APEX能力,我们构建包含1000万以上分子的基准CSL,所有分子均标注了其在五个医学相关靶点上的结合得分,以及由RDKit测得的物理化学性质,使得对于任意目标与约束集合,都可识别并比较检索结果。我们表明APEX在检索准确性和运行时性能上均持续表现优异。
引用
@article{arxiv.2510.24380,
title = {APEX: Approximate-but-exhaustive search for ultra-large combinatorial synthesis libraries},
author = {Aryan Pedawi and Jordi Silvestre-Ryan and Bradley Worley and Darren J Hsu and Kushal S Shah and Elias Stehle and Jingrong Zhang and Izhar Wallach},
journal= {arXiv preprint arXiv:2510.24380},
year = {2025}
}