中文

基于Mixup的图学习用于语言处理中混合池化的有效性

机器学习 2024-05-24 v3 人工智能

摘要

基于图神经网络(GNN)的图学习在自然语言与编程语言处理中颇受欢迎,尤其在文本与源代码分类方面。通常,GNN由交替层构建:学习图节点特征变换的层,以及使用图池化算子(如最大池化)在保留图语义信息的同时有效减少节点数量的图池化层。近来,为增强GNN在图学习任务中的表现,Manifold-Mixup这一通过对一对图数据及其标签进行线性混合来生成合成图数据的数据增强技术已被广泛采用。然而,Manifold-Mixup的性能可能高度受图池化算子影响,且专门揭示此种影响的研究尚不多见。为弥补此不足,我们迈出了探索图池化算子如何影响基于Mixup的图学习性能的早期一步。为此,我们将Manifold-Mixup应用于基于11种图池化操作(9种混合池化算子、2种非混合池化算子)的图池化形式化表征,开展全面实证研究。在自然语言数据集(Gossipcop、Politifact)与编程语言数据集(JAVA250、Python800)上的实验结果表明,就生成更准确且鲁棒的GNN模型而言,混合池化算子比标准最大池化及最先进的图多集变换器(GMT)池化更有效。

关键词

引用

@article{arxiv.2210.03123,
  title  = {On the Effectiveness of Hybrid Pooling in Mixup-Based Graph Learning for Language Processing},
  author = {Zeming Dong and Qiang Hu and Zhenya Zhang and Yuejun Guo and Maxime Cordy and Mike Papadakis and Yves Le Traon and Jianjun Zhao},
  journal= {arXiv preprint arXiv:2210.03123},
  year   = {2024}
}

备注

Accepted by Journal of Systems and Software (JSS) 2024