中文

何时有用?面向靶向条件分子性质预测的系统性研究

机器学习 2026-04-09 v1 生物大分子 分子网络

摘要

我们进行了首个系统性研究,探讨靶标上下文是否对分子性质预测有帮助,评估了跨10个多样化蛋白家族、4种融合架构、67-9409种训练化合物的不同数据规模,以及时间和随机评估划分情况下的上下文条件化。使用 NestDrug—a 基于 FiLM 的架构对分子表示在靶标身份上进行条件化,我们描绘了成功与失败模式,提出了三个主要发现。首先,融合架构占主导地位:FiLM 以24.2个百分点和加法条件化以8.6个百分点超过拼接方法;如何引入上下文比是否包含它更重要。其次,上下文使得原本不可能的预测成为可能:在数据稀缺的CYP3A4(仅67个训练化合物)上,多任务迁移实现了0.686的AUC,而单靶标随机森林退化为0.238。第三,上下文会系统性地造成损害:分布不匹配在BACE1上导致10.2个百分点的下降;少样本适应始终低于零样本。除方法论外,我们暴露了标准基准测试的根本性缺陷:1-最近邻Tanimoto在DUD-E上无需学习即可实现0.991的AUC,且50%的活性化合物从训练数据中泄漏,使绝对性能指标毫无意义。我们的 temporal split 评估(训练至2020年,测试2021-2024年)实现了稳定的0.843 AUC且无退化,提供了首个证据表明上下文条件化的分子表示可推广至未来的化学空间。

关键词

引用

@article{arxiv.2604.06558,
  title  = {When Does Context Help? A Systematic Study of Target-Conditional Molecular Property Prediction},
  author = {Bryan Cheng and Jasper Zhang},
  journal= {arXiv preprint arXiv:2604.06558},
  year   = {2026}
}

备注

9 pages, 5 figures. Accepted at Workshop on AI for Accelerated Materials Design and Foundation Models for Science: Real-World Impact and Science-First Design at ICLR 2026