评估药物发现中神经网络的点预测不确定性
机器学习
2022-11-01 v1 应用统计
摘要
神经网络(NN)模型有潜力加速药物发现过程并降低其失败率。由于药物发现探索的是超出训练数据分布的化学生空间,NN 模型的成功需要不确定性量化(UQ)。标准 NN 模型不提供不确定性信息。将贝叶斯模型与 NN 模型结合的方法解决了这一问题,但难以实现且训练成本更高。某些方法需要改变 NN 架构或训练流程,限制了 NN 模型的选择。此外,预测不确定性可能来自不同来源。能够分别建模不同类型的预测不确定性十分重要,因为模型可根据不确定性来源采取不同行动。本文考察了针对药物发现 NN 模型、估计不同预测不确定性来源的方法。我们利用对化合物的先验知识设计实验。通过可视化方法,从化合物集合中创建不重叠且化学多样的分区。这些分区用作训练集与测试集划分以探究 NN 模型不确定性。我们展示了所选方法估计的不确定性如何在不同分区与特征化方案下描述不同不确定性来源,及其与预测误差的关系。
引用
@article{arxiv.2210.17043,
title = {Evaluating Point-Prediction Uncertainties in Neural Networks for Drug Discovery},
author = {Ya Ju Fan and Jonathan E. Allen and Kevin S. McLoughlin and Da Shi and Brian J. Bennion and Xiaohua Zhang and Felice C. Lightstone},
journal= {arXiv preprint arXiv:2210.17043},
year = {2022}
}