分子结构无法说明的东西:基于GNN的药物毒性预测中的可解释性缺口分类
定量方法
2026-05-27 v1 机器学习
摘要
图神经网络(GNN)因直接在原子连通性上工作,无需固定长度指纹,因而避免了信息丢失,已成为分子毒性预测的结构天然方法。然而,药物已知药理剂型中可被编码在分子结构中的比例仍被系统性地未被充分探索。本研究以乙酰水杨酸(ASA,阿司匹林)——一种药理学上最为全面被characterize的药物为模型化合物,进行系统性案例研究。训练一个消息传递神经网络(MPNN)在Tox21基准数据集上,并应用GNNExplainer来刻画原子级别的归因。结果表明,分子结构解释了约45%(5/11)的已知ASA不良反应。引入四类缺口分类法(GAP-1至GAP-4),区分原则上不可编码的效应、源于Missing Not At Random(MNAR)机制的数据缺口、试验板不匹配以及表示误差。通过系统性ChEMBL查询对MNAR缺口进行经验量化(42个已记录试验,0个可检索生物活性条目)。注意力池化实验将表示误差局部化到MPNN消息传递层而非聚合步骤。该缺口分类法直接影响药物安全信号检测工作流程和监管框架,包括良好药物学守则(GVP)和新方法(NAMs)。
关键词
引用
@article{arxiv.2605.26183,
title = {What Molecular Structure Cannot Tell Us: A Taxonomy of Explainability Gaps in GNN-Based Drug Toxicity Prediction},
author = {Juergen Dietrich},
journal= {arXiv preprint arXiv:2605.26183},
year = {2026}
}
备注
14 pages