中文

GNN-LM:基于图神经网络利用全局上下文的语言建模

计算与语言 2022-05-05 v5

摘要

受“复制易于记忆”这一观念的启发,本文引入 GNN-LM,其通过允许引用整个训练语料中相似上下文来扩展原始神经语言模型(LM)。我们在输入上下文与从训练语料中检索的语义相关邻居之间构建有向异构图,其中节点为输入上下文及检索到的邻居上下文中的词元,边表示节点间的连接。在该图上构建图神经网络(GNNs)以聚合来自相似上下文的信息来解码词元。该学习范式提供对参考上下文的直接访问,并有助于提升模型的泛化能力。我们进行了全面实验以验证 GNN-LM 的有效性:GNN-LM 在 WikiText-103 上取得了 14.8 的新的最优困惑度(比原始 LM 模型对应项提升 3.9 点),并在 One Billion Word 和 Enwiki8 数据集上相较强基线显示出实质性改进。进行了深入的消融研究以理解 GNN-LM 的机制。\footnote{代码见 https://github.com/ShannonAI/GNN-LM

关键词

引用

@article{arxiv.2110.08743,
  title  = {GNN-LM: Language Modeling based on Global Contexts via GNN},
  author = {Yuxian Meng and Shi Zong and Xiaoya Li and Xiaofei Sun and Tianwei Zhang and Fei Wu and Jiwei Li},
  journal= {arXiv preprint arXiv:2110.08743},
  year   = {2022}
}

备注

To appear at ICLR 2022