VECT-GAN:一种变分编码生成模型,用于药物科学中的数据稀缺问题
机器学习
2025-01-20 v2
摘要
药物研究中的数据稀缺导致依赖于耗时的试错方法进行开发,而非数据驱动方法。虽然机器学习提供了解决方案,但现有数据集常常小且噪声大,限制了其实用性。为此,我们开发了一种变分编码条件表格生成对抗网络(Variationally Encoded Conditional Tabular Generative Adversarial Network, VECT-GAN),这是一种专为增强小且噪声数据的生成模型而设计的新型模型。我们引入了一个管道,其中在回归模型开发之前对数据进行增强,表明这一方法一致且显著地提高了其他最先进表格生成模型的性能。我们将此管道应用于六个药物数据集,并通过开发具有医学可接受黏附性的新型聚合物并进行实验表征来展示其实际应用性。此外,我们在 ChEMBL 数据库上对模型进行预训练,利用知识蒸馏来增强其泛化能力,使其可立即用于包含小分子的药物数据集中,这是极其常见的药物任务。我们展示了合成数据对正规化小型表格数据集的强大潜力,突显了其在药物模型开发中可能成为标准实践的潜力,并将该方法(包括在 ChEMBL 上预训练的 VECT-GAN)作为 pip 软件包提供。
引用
@article{arxiv.2501.08995,
title = {VECT-GAN: A variationally encoded generative model for overcoming data scarcity in pharmaceutical science},
author = {Youssef Abdalla and Marrisa Taub and Eleanor Hilton and Priya Akkaraju and Alexander Milanovic and Mine Orlu and Abdul W. Basit and Michael T Cook and Tapabrata Chakraborti and David Shorthouse},
journal= {arXiv preprint arXiv:2501.08995},
year = {2025}
}
备注
30 pages, 6 primary figures, 3 supplementary figures