中文

基于骨架的生成性数据增强与重排序以提升虚拟筛选效果

机器学习 2026-01-22 v2 人工智能

摘要

配体基虚拟筛选(VS)是药物发现中的关键步骤,通过评估大型化合物库来识别潜在结合治疗靶点的化合物。然而,虚拟筛选面临三个主要挑战:由于活性化合物活性率低导致的类别不平衡、活性分子中某些骨架主导导致的结构不平衡,以及为新药开发需要识别结构多样的活性化合物。我们引入ScaffAug,一个面向骨架的虚拟筛选框架,通过三个模块来解决上述挑战。数据增强模块首先使用生成模型( Specifically,图扩散模型)在实际活性分子的骨架条件下生成合成数据。这有助于缓解类别不平衡问题,进一步由于我们提出的面向骨架的采样算法而解决结构不平衡问题,该算法旨在为活性分子中欠representative骨架生成更多样本。随后使用模型不可知的自训练模块安全地将来自数据增强模块的生成合成数据与原始标记数据集成。最后,我们引入了重排序模块,通过增强前N推荐分子集合中的骨架多样性,同时保持甚至提升整体性能,以识别新颖活性化合物。我们在五个靶点类别上进行了全面的计算实验,比较ScaffAug与现有基线方法,通过报告多个评估指标性能并对ScaffAug进行消融研究。总体而言,本工作从生成性数据增强、重排序和全面骨架意识等角度,为有效提升虚拟筛选提供了新颖视角。

关键词

引用

@article{arxiv.2510.16306,
  title  = {Scaffold-Aware Generative Augmentation and Reranking for Enhanced Virtual Screening},
  author = {Xin Wang and Yu Wang and Yunchao Liu and Jens Meiler and Tyler Derr},
  journal= {arXiv preprint arXiv:2510.16306},
  year   = {2026}
}