中文

预训练是否诱导系统性推理?掩码语言模型如何习得常识知识

计算与语言 2021-12-17 v1

摘要

以掩码语言建模为目标预训练的 Transformer 模型(如 BERT)编码了常识知识,这一点已通过行为探针得到证实;然而,这些知识在多大程度上是通过对预训练语料语义的系统性推理而习得,仍是一个开放问题。为回答该问题,我们在预训练期间向 BERT 模型的小批量中选择性注入言语化知识,并评估模型对所受支持推理的泛化能力。我们发现泛化能力在预训练过程中并未提升,这表明常识知识是从表层共现模式中习得,而非由诱导性的系统性推理获得。

关键词

引用

@article{arxiv.2112.08583,
  title  = {Does Pre-training Induce Systematic Inference? How Masked Language Models Acquire Commonsense Knowledge},
  author = {Ian Porada and Alessandro Sordoni and Jackie Chi Kit Cheung},
  journal= {arXiv preprint arXiv:2112.08583},
  year   = {2021}
}