中文

WelQrate: 定义小分子药物发现基准测试的金标准

机器学习 2024-12-03 v1 人工智能 生物大分子

摘要

虽然深度学习彻底改变了计算机辅助药物发现,但 AI 社区主要关注模型创新,较少重视建立最佳基准测试实践。我们认为,如果没有合理的模型评估框架,AI 社区的努力无法发挥全部潜力,从而减缓创新向现实药物发现的进展与转化。因此,本文旨在为小分子药物发现基准测试建立新的金标准 WelQrate。具体而言,我们的贡献有三方面:WelQrate 数据集收集——我们引入了一个经过精心策划的 9 个数据集集合,涵盖 5 类治疗靶点。我们由药物发现专家设计的分层策划流程,超越了初级高通量筛选,利用额外的确证性筛选和反筛选,以及严格的领域驱动预处理(如 Pan-Assay Interference Compounds (PAINS) 过滤),确保数据集的高质量;WelQrate 评估框架——我们提出了一个标准化的模型评估框架,考虑高质量数据集、特征化、三维构象生成、评估指标和数据划分,为从事真实虚拟筛选的药物发现专家提供可靠的基准测试;基准测试——我们利用 WelQrate 数据集集合,通过各种研究问题评估模型性能,探究不同模型、数据集质量、特征化方法和数据划分策略对结果的影响。总之,我们建议采用我们提出的 WelQrate 作为小分子药物发现基准测试的金标准。WelQrate 数据集集合、策划代码和实验脚本均在 WelQrate.org 公开获取。

关键词

引用

@article{arxiv.2411.09820,
  title  = {WelQrate: Defining the Gold Standard in Small Molecule Drug Discovery Benchmarking},
  author = {Yunchao Liu and Ha Dong and Xin Wang and Rocco Moretti and Yu Wang and Zhaoqian Su and Jiawei Gu and Bobby Bodenheimer and Charles David Weaver and Jens Meiler and Tyler Derr},
  journal= {arXiv preprint arXiv:2411.09820},
  year   = {2024}
}