基于结构的药物设计中,何为表达力过低或过高?
机器学习
2025-03-04 v2 生物大分子
摘要
已提出若干具有精细训练和采样程序的生成模型,以加速结构驱动药物设计(SBDD);然而,其实际效果却不尽如人意。我们从理论和实证两个角度探讨这一现象。由于大多数模型应用图神经网络(GNNs),人们或许会怀疑它们继承了GNNs的表示局限性。我们对此进行分析,首次针对蛋白-配体复合物给出此类结果。另一种可能的观点认为,这些模型的表现不佳归因于其参数化过度,导致表达力提升但牺牲了泛化能力。我们通过一种简单且具有度量意义的 approach 来检验这一假设,该 approach 学习一种针对未标记分子图的亲和力经济代理,以推断未标记的分子图并优化该图和分子属性条件下的标签。最终得到的模型使用仅100倍可训练参数即可实现最新成果,并实现了最高可达1000倍的加速。总体而言,我们的发现凸显了有必要重新评估和重新定位SBDD的现有范式和努力。代码已公开于https://github.com/rafalkarczewski/SimpleSBDD。
引用
@article{arxiv.2408.06050,
title = {What Ails Generative Structure-based Drug Design: Expressivity is Too Little or Too Much?},
author = {Rafał Karczewski and Samuel Kaski and Markus Heinonen and Vikas Garg},
journal= {arXiv preprint arXiv:2408.06050},
year = {2025}
}
备注
AISTATS 2025 (Oral)