片段偏置(Fragment-Biases)用于分子图神经网络的表达性与泛化性
机器学习
2024-07-26 v2
摘要
尽管近期的高阶图神经网络(GNNs)在理论表达性和分子性质预测性能方面取得了进展,但它们往往不足以匹配那些显式使用片段信息作为归纳偏置的模型的经验性能。然而,对于这些方法,尚不存在理论表达性研究。本文提出了Fragment-WL检验,这是一种对著名Weisfeiler & Leman(WL)检验的扩展,使我们能够对这些片段偏置GNN进行理论分析。基于Fragment-WL检验获得的见解,我们开发了一种新的GNN架构和一种具有无限词汇的片段化方法,显著提升了表达性。我们在合成数据和真实数据上展示了该模型的有效性,在Peptides数据集上超越了所有GNN,在ZINC数据集上比所有GNN的误差低出12%,比其他片段偏置模型的误差低出34%。此外,我们展示了该模型在泛化能力方面优于最新的基于transformer的架构,使其成为分子建模任务的稳健解决方案。
引用
@article{arxiv.2406.08210,
title = {Expressivity and Generalization: Fragment-Biases for Molecular GNNs},
author = {Tom Wollschläger and Niklas Kemper and Leon Hetzel and Johanna Sommer and Stephan Günnemann},
journal= {arXiv preprint arXiv:2406.08210},
year = {2024}
}