Lo-Hi:实用的机器学习药物发现基准
机器学习
2023-10-11 v1 人工智能
摘要
发现新药正变得越来越困难。药物发现的希望之一是利用机器学习模型预测分子性质。正因如此,分子性质预测模型正在 MoleculeNet 等基准上被开发和测试。然而,现有基准不切实际,与应用模型于实践的情形相差甚远。我们创建了一个实用的新基准 \emph{Lo-Hi},包含两项任务:先导化合物优化(Lo)和苗头化合物识别(Hi),对应于真实的 drug discovery 流程。对于 Hi 任务,我们设计了一种新颖的分子划分算法,解决了平衡顶点最小 -Cut 问题。我们测试了 state-of-the-art 和经典的 ML 模型,揭示了在实用设置下哪些模型表现更好。我们分析了现代基准,表明它们不切实际且过于乐观。Review: https://openreview.net/forum?id=H2Yb28qGLV Lo-Hi benchmark: https://github.com/SteshinSS/lohi_neurips2023 Lo-Hi splitter library: https://github.com/SteshinSS/lohi_splitter
引用
@article{arxiv.2310.06399,
title = {Lo-Hi: Practical ML Drug Discovery Benchmark},
author = {Simon Steshin},
journal= {arXiv preprint arXiv:2310.06399},
year = {2023}
}
备注
29 pages, Advances in Neural Information Processing Systems, 2023