仅拓扑预训练:迈向泛化多域图模型
机器学习
2024-12-03 v4 人工智能
摘要
无监督表示学习的主要益处在于预训练模型可在数据或标签稀缺处进行微调。现有的图表示学习方法均是领域特定的,在预训练与目标数据集中保持一致的节点与边特征。这阻碍了向多领域的迁移。我们提出仅拓扑预训练(ToP),一种基于节点与边特征排除的图预训练方法。我们在来自多领域的评估数据集上展示了正向迁移,包括预训练数据中不存在的领域,这直接与当代工作中的假设相悖。在 75% 的实验中,ToP 模型显著(p ≤ 0.01)优于有监督基线。当微调中使用节点与边特征时,在 85.7% 的任务上性能显著为正。我们进一步表明,域外拓扑可比域内拓扑产生更有用的预训练。在 ToP 下,我们在 79% 的分子基准上展示了相比分子预训练更好的从非分子预训练而来的迁移。相较于有限的其他通才图模型集合,ToP 表现强劲,包括对比参数量级大许多的模型。这些发现表明 ToP 在稀疏图领域的迁移学习以及图基础模型研究中开辟了广阔领域。
引用
@article{arxiv.2311.03976,
title = {Topology Only Pre-Training: Towards Generalised Multi-Domain Graph Models},
author = {Alex O. Davies and Riku W. Green and Nirav S. Ajmeri and Telmo M. Silva Filho},
journal= {arXiv preprint arXiv:2311.03976},
year = {2024}
}
备注
28 pages, 5 figures, 5 tables. For in-development code see https://github.com/neutralpronoun/general-gcl