用于图到文本生成的自监督图掩码预训练
计算与语言
2022-10-20 v1
摘要
大规模预训练语言模型(PLMs)通过处理图的线性化版本推进了图到文本(G2T)生成。然而,线性化会忽略结构信息。此外,PLMs 通常在自由文本上预训练,这引入了预训练与下游 G2T 生成任务之间的领域失配。为应对这些不足,我们提出图掩码预训练策略,其既不需要监督信号,也不调整底层预训练编码器-解码器模型的架构。当与预训练的 T5 配合使用时,我们的方法在 WebNLG+2020 与 EventNarrative G2T 生成数据集上取得了新的 SOTA 结果。我们的方法在低资源设定下也表现出极高有效性。
引用
@article{arxiv.2210.10599,
title = {Self-supervised Graph Masking Pre-training for Graph-to-Text Generation},
author = {Jiuzhou Han and Ehsan Shareghi},
journal= {arXiv preprint arXiv:2210.10599},
year = {2022}
}
备注
EMNLP 2022; code is available at https://github.com/Jiuzhouh/Graph-Masking-Pre-training