中文

为何单独传播?图上标签与特征的并行使用

机器学习 2021-10-15 v1

摘要

图神经网络(GNNs)与标签传播代表了两种相互关联的建模策略,旨在节点属性预测等任务中利用图结构。前者通常基于堆叠的消息传递层,共享邻域信息以将节点特征转换为预测嵌入。相反,后者通过无参数扩散过程将标签信息传播至未标注节点,但独立于节点特征运行。鉴于二者的实质差异仅在于跨图平滑的是特征还是标签,自然可考虑将二者结合以提升性能。对此,近期提出将随机选取的部分训练标签作为 GNN 输入,与原始节点特征拼接以对剩余标签进行预测。这一所谓标签技巧适应了特征与标签的并行使用,并且是 Open Graph Benchmark (OGB) 排行榜上许多排名靠前提交方案的基础。然而尽管被广泛采用,迄今鲜有尝试仔细剖析标签技巧给训练流程引入的统计学性质(无论有意与否)。为此,我们证明在特定简化假设下,随机标签技巧可化简为可解释的确定性训练目标,其由两项构成。第一项为数据拟合项,自然化解潜在的标签泄露问题;第二项则为依赖于图结构的正则化因子,自适应于图规模与连通性。随后,我们利用该视角引申出更广泛的标签技巧用例,并给出实验验证这些扩展的有效性。

关键词

引用

@article{arxiv.2110.07190,
  title  = {Why Propagate Alone? Parallel Use of Labels and Features on Graphs},
  author = {Yangkun Wang and Jiarui Jin and Weinan Zhang and Yongyi Yang and Jiuhai Chen and Quan Gan and Yong Yu and Zheng Zhang and Zengfeng Huang and David Wipf},
  journal= {arXiv preprint arXiv:2110.07190},
  year   = {2021}
}