中文

GraSAME:通过图引导自注意力机制向预训练语言模型注入词元级结构信息

计算与语言 2024-04-11 v1

摘要

预训练语言模型(PLMs)受益于存储在图结构中的外部知识,以用于各种下游任务。然而,弥合图结构与文本之间的模态鸿沟仍是一个重大挑战。传统方法如将图线性化以适配 PLMs 会丢失关键的图连通性,而图神经网络(GNNs)则需要繁琐的过程才能集成到 PLMs 中。在本工作中,我们提出了一种新颖的图引导自注意力机制 GraSAME。GraSAME 将词元级结构信息无缝融入 PLMs,无需额外的对齐或拼接操作。作为一个端到端的轻量级多模态模块,GraSAME 遵循多任务学习策略,有效弥合图与文本模态之间的鸿沟,促进 GNNs 与 PLMs 之间的动态交互。我们在图到文本生成任务上的实验表明,GraSAME 优于基线模型,并在 WebNLG 数据集上取得了与最先进(SOTA)模型相当的结果。此外,与 SOTA 模型相比,GraSAME 无需额外的预训练任务来调整图输入,并将可训练参数减少了超过 1 亿。

关键词

引用

@article{arxiv.2404.06911,
  title  = {GraSAME: Injecting Token-Level Structural Information to Pretrained Language Models via Graph-guided Self-Attention Mechanism},
  author = {Shuzhou Yuan and Michael Färber},
  journal= {arXiv preprint arXiv:2404.06911},
  year   = {2024}
}

备注

NAACL 2024 Findings