中文

用于分子测量预测的图论模型

机器学习 2026-04-23 v1 定量方法

摘要

图论方法为分子性质预测提供了简单性、可解释性和低计算成本。其中,Mukwembi 和 Nyabadza 提出的基于外部活动度 D(G)D(G) 和内部活动度 ζ(G)\zeta(G) 指数的模型在小型类黄酮数据集上取得了优异结果。然而,其泛化到更大且化学多样性更丰富的数据集的能力尚未得到检验。本研究在来自 MoleculeNet 的五个基准数据集上评估了基线 D(G)D(G)-ζ(G)\zeta(G) 多项式模型,涵盖生物活性(BACE,1,513 个分子)、亲脂性(LogP synthetic,14,610 个分子;LogP experimental,753 个分子)、水溶性(ESOL,1,128 个分子)和水合自由能(SAMPL,642 个分子)。基线模型的平均 R2=0.24R^2 = 0.24,证实了其有限的迁移性。为解决此问题,本文提出了一个系统性增强框架,逐步引入 Ridge 正则化、额外的图描述符、物理化学性质、集成学习与 Gradient Boosting、Lasso 特征选择,以及结合拓扑指数与 Morgan 指纹的混合方法。增强后的模型将平均最佳 R2R^2 提升至 0.79,单项改进幅度从 165% 到 274% 不等。所有改进均具有统计学意义(p<0.001p < 0.001)。在相同实验条件下与图卷积网络(Graph Convolutional Network)的直接比较表明,增强后的经典模型在所有五个数据集上均达到或优于深度学习的表现。与 Djagba 等人最近的 GNN+PGM 混合模型的比较进一步证实了其竞争力,增强后的模型在两个数据集上取得了最佳结果,并在一个数据集上打平。整个框架无需 GPU,训练时间不到五分钟,且仅使用开源工具,使其适用于资源受限环境下的研究人员。

关键词

引用

@article{arxiv.2604.19840,
  title  = {Graph-Theoretic Models for the Prediction of Molecular Measurements},
  author = {Anna Niane and Prudence Djagba},
  journal= {arXiv preprint arXiv:2604.19840},
  year   = {2026}
}