中文

基于 CKA 表示分析的分子回归任务 GNN 模型基准测试

机器学习 2026-03-10 v2

摘要

分子通常表示为 SMILES 字符串,可直接转换为固定大小的分子指纹。这些指纹作为特征向量用于训练机器学习/深度学习模型,以完成计算化学、药物发现、生化和材料科学等领域的分子性质预测任务。近期研究表明,SMILES 可用于构建分子图,其中原子为节点(VV),键为边(EE),随后可用于训练几何 DL 模型如 GNN。GNN 学习分子中固有的结构关系,而非依赖固定大小的指纹。尽管 GNN 是强大的聚合器,但其在小型数据集上的效能以及不同架构之间的归纳偏差仍受较少关注。本研究系统性地对四种不同 GNN 架构进行基准测试,涵盖物理化学、生物和分析等多样化数据集。此外,我们还实现了一个层次化融合(GNN+FP)框架用于目标预测。我们发现,融合框架在性能上始终优于或相当于单独使用 GNN(RMSE 改善 > 7%7\%),并优于基线模型。进一步地,我们使用中心化核对齐(CKA)探讨了 GNN 与指纹嵌入之间的表征相似性,发现它们占据高度独立的潜在空间(CKA 0.46\le0.46)。跨架构 CKA 分数表明,类似模型如 GCN、GraphSAGE 和 GIN 之间高度收敛(CKA 0.88\geq0.88),而 GAT 学习的表征较为独立(CKA 0.550.800.55-0.80)。

关键词

引用

@article{arxiv.2602.20573,
  title  = {Benchmarking GNN Models on Molecular Regression Tasks with CKA-Based Representation Analysis},
  author = {Rajan and Ishaan Gupta},
  journal= {arXiv preprint arXiv:2602.20573},
  year   = {2026}
}

备注

10 pages, 5 figures and 2 tables