少而精:图神经网络预训练的数据主动视角
机器学习
2023-11-22 v2 社会与信息网络
摘要
图神经网络(GNNs)上的预训练旨在利用无标签数据为下游任务学习可迁移知识,近来已成为一个活跃的研究领域。图预训练模型的成功常归因于海量输入数据。然而,本文中我们识别出图预训练中的大数据诅咒现象:更多训练数据未必带来更好的下游性能。受此观察启发,我们提出一种图预训练的“少而精”框架:将更少但精心选择的数据输入GNN模型以增强预训练。所提出的预训练流程称为数据主动图预训练(APT)框架,由图选择器和预训练模型组成。图选择器基于图的内在属性以及预测不确定性选择最具代表性和指导性的数据点。所提出的预测不确定性作为来自预训练模型的反馈,衡量模型对数据的置信水平。另一方面,当输入所选数据时,预训练模型掌握对新、未见过数据的初步理解,同时试图记住从先前数据学到的知识。因此,这两个组件的融合与交互形成了一个统一框架(APT),其中图预训练以渐进和迭代的方式执行。实验结果表明,所提出的APT能够以更少的训练数据和更好的下游性能获得高效的预训练模型。
引用
@article{arxiv.2311.01038,
title = {Better with Less: A Data-Active Perspective on Pre-Training Graph Neural Networks},
author = {Jiarong Xu and Renhong Huang and Xin Jiang and Yuxuan Cao and Carl Yang and Chunping Wang and Yang Yang},
journal= {arXiv preprint arXiv:2311.01038},
year = {2023}
}