为何深度模型在分子性质预测上常无法胜过非深度模型?
机器学习
2023-07-03 v1 计算工程、金融与科学
摘要
分子性质预测(MPP)是药物发现流程中的一项关键任务,近年来因深度神经网络的进展而受到相当关注。然而,近期研究揭示深度模型在MPP上难以击败传统的非深度模型。在本研究中,我们在14个分子数据集上基准测试了12个代表性模型(3个非深度模型和9个深度模型)。通过迄今最全面的研究,我们做出以下关键观察:\textbf{(\romannumeral 1)} 深度模型通常无法优于非深度模型;\textbf{(\romannumeral 2)} 深度模型在MPP上的失败不能仅归因于分子数据集规模小,关键在于不规则的分子数据模式;\textbf{(\romannumeral 3)} 具体而言,以分子指纹作为输入的特征树模型往往优于其他竞争者。此外,我们对分子数据的独特模式及导致这些现象的各模型归纳偏置进行了广泛的实证探究。
引用
@article{arxiv.2306.17702,
title = {Why Deep Models Often cannot Beat Non-deep Counterparts on Molecular Property Prediction?},
author = {Jun Xia and Lecheng Zhang and Xiao Zhu and Stan Z. Li},
journal= {arXiv preprint arXiv:2306.17702},
year = {2023}
}
备注
Work in Process. The primary version has been accepted as a Spotlight Talk at ICML2023 Computational Biology & ICML2023 IMLH Workshop