扩散模型生成的合成数据提升药物发现预测效果
机器学习
2024-05-08 v1 人工智能
定量方法
摘要
人工智能 (AI) 正在药物开发各阶段日益普及。对于药物发现的人工智能方法而言,持续的突破需要创建、改进和完善药物发现数据。我们提出了新的一种数据挑战,限制了药物发现 AI 的进步:数据集通常独立收集,彼此之间重叠度小,导致数据稀疏。数据稀疏使得寻求跨多个数据集所需关键研究问题的值时,数据 curated 变得困难。我们提出了一种新型扩散图神经网络模型 Syngand,能够端到端生成配体和药代动力学数据。我们展示并提供了使用 Syngand 模型对现有配体进行采样药代动力学数据的方法。我们展示了 Syngand 生成的合成靶标性质数据在下游回归任务中(如 AqSolDB、LD50 和 hERG 中)的初始有前景的效果。使用我们提出的模型和方法,研究人员可以轻松生成合成配体数据,以帮助他们探索需要跨越多个数据集的数据的研究问题。
引用
@article{arxiv.2405.03799,
title = {Synthetic Data from Diffusion Models Improve Drug Discovery Prediction},
author = {Bing Hu and Ashish Saragadam and Anita Layton and Helen Chen},
journal= {arXiv preprint arXiv:2405.03799},
year = {2024}
}