面向表型药物发现的神经缩放定律
机器学习
2023-10-02 v1 人工智能
计算机视觉与模式识别
定量方法
摘要
深度神经网络(DNNs)在自然语言处理(NLP)与计算机视觉中的近期突破由模型与数据的规模扩大驱动,而非新计算范式的发现。此处我们研究规模是否对旨在辅助小分子药物发现的模型有类似影响。我们通过大规模系统性分析DNN大小、数据配比与学习例程如何交互影响我们在表型化学竞技场(Pheno-CA)基准上的精度来探讨此问题:该基准为基于图像的高内涵筛选数据上提出的一组多样药物开发任务。令人惊讶的是,我们发现显式监督以求解Pheno-CA中任务的DNNs并不随数据与模型规模扩大而持续改进。为解决此问题,我们引入新颖的前驱任务——逆生物过程(IBP),其设计类似已在NLP中被证明成功的因果目标函数。我们确实发现,先以IBP训练再探测Pheno-CA性能的DNNs显著优于任务监督的DNNs。更重要的是,这些IBP训练DNNs的性能随数据与模型规模单调提升。我们的发现揭示了准确求解小分子药物开发任务所需的DNN要素已在掌握之中,并预估了达成任意期望改进水平还需多少实验数据。我们发布Pheno-CA基准与代码以鼓励对小分子药物发现神经缩放定律的进一步研究。
引用
@article{arxiv.2309.16773,
title = {Neural scaling laws for phenotypic drug discovery},
author = {Drew Linsley and John Griffin and Jason Parker Brown and Adam N Roose and Michael Frank and Peter Linsley and Steven Finkbeiner and Jeremy Linsley},
journal= {arXiv preprint arXiv:2309.16773},
year = {2023}
}