基于片段筛选活动的有意义机器学习模型与机器学习的药效团
生物大分子
2022-04-14 v1 机器学习
定量方法
摘要
机器学习(ML)被广泛用于药物发现中以训练预测蛋白-配体结合的模型。这些模型对药物化学家极具价值,尤其是当它们能提供针对具体案例的、驱动结合过程的物理相互作用的见解时。在本研究中,我们从50多个片段筛选活动中导出 ML 模型,并引入两个我们认为在迄今报道的绝大多数(即便不是全部)此类 ML 研究中缺失的重要元素:第一,除用于训练模型的观测命中化合物外,我们纳入了真实的未命中化合物,并表明这些经实验验证的负数据对所得模型的质量具有显著重要性。第二,我们提供了对 ML 模型认为对成功结合重要的内容的一种物理可解释且可验证的表示。该表示源自一种直接的归因过程,其从化学环境(相互)作用的角度解释预测。关键的是,我们针对专家分子建模师独立做出的先前标注,在大规模上验证了归因结果。即使模型在区分命中与未命中方面的表现远非完美,我们也发现 ML 模型提出的关键分子子结构与人工指定的那些具有良好一致性。通过将归因投影到预定义的交互原型(药效团)上,我们表明 ML 允许我们从筛选数据中自动制定关于什么驱动片段针对靶标结合的简单规则。
引用
@article{arxiv.2204.06348,
title = {Meaningful machine learning models and machine-learned pharmacophores from fragment screening campaigns},
author = {Carl Poelking and Gianni Chessari and Christopher W. Murray and Richard J. Hall and Lucy Colwell and Marcel Verdonk},
journal= {arXiv preprint arXiv:2204.06348},
year = {2022}
}