中文

常识还是世界知识?探究基于适配器的知识注入预训练 Transformer

计算与语言 2020-10-13 v2

摘要

继 BERT 或 GPT-2 等神经语言模型 (LM) 在各种语言理解任务上取得重大成功后,近期工作侧重于将外部资源中的(结构化)知识注入这些模型。一方面,联合预训练(即从头开始训练,在主要 LM 目标基础上增加基于外部知识的目标)可能在计算上过于昂贵;另一方面,在外部知识上进行事后微调可能导致灾难性遗忘分布知识。在这项工作中,我们研究了使用适配器训练,分别用来自 ConceptNet 及其对应的 Open Mind Common Sense (OMCS) 语料库的概念知识来补充 BERT 的分布知识的模型。虽然 GLUE 基准上的总体结果描绘了一幅不确定的图景,但更深入的分析表明,我们基于适配器的模型在需要 ConceptNet 和 OMCS 中明确存在的概念知识类型的推理任务上,大幅优于 BERT(性能提升高达 15-20 个点)。所有代码和实验均在以下地址开源:https://github.com/wluper/retrograph。

关键词

引用

@article{arxiv.2005.11787,
  title  = {Common Sense or World Knowledge? Investigating Adapter-Based Knowledge Injection into Pretrained Transformers},
  author = {Anne Lauscher and Olga Majewska and Leonardo F. R. Ribeiro and Iryna Gurevych and Nikolai Rozanov and Goran Glavaš},
  journal= {arXiv preprint arXiv:2005.11787},
  year   = {2020}
}

备注

EMNLP 2020 - DeeLIO, ECML 2020 - DECODEML, 5 pages, 4 tables, 3 references