中文

以义项级精度与扩展词表探查预训练语言模型中的常识知识

计算与语言 2022-10-13 v1 人工智能

摘要

常识推理的进展通常通过要求在问答任务上需要常识知识性能提升来衡量。然而,在这些特定任务上微调大型语言模型(LM)并不能直接评估预训练期间学到的常识。对预训练LM中常识知识最直接的评估可谓是面向常识断言(如“笔被用来[MASK]。”)的完形填空式任务。但该方法受限于LM可用于掩码预测的词汇表,且其精度受限于断言所提供的上下文。本工作中,我们提出一种方法,在词汇层面以扎根义项词库(即WordNet)丰富LM,无需进一步训练。该修改将完形填空式提示的预测空间扩充至大型本体规模,同时支持更细粒度(义项级)的查询与预测。为更高精度评估LM,我们提出SenseLAMA,一个完形填空式任务,其特色来自WordNet、WikiData与ConceptNet中消歧三元组的动词化关系。将我们的方法应用于BERT,产生名为SynBERT的WordNet丰富版本,我们发现LM能从自监督中学到非平凡的常识知识,覆盖众多关系,且比可比的基于相似度的方法更有效。

关键词

引用

@article{arxiv.2210.06376,
  title  = {Probing Commonsense Knowledge in Pre-trained Language Models with Sense-level Precision and Expanded Vocabulary},
  author = {Daniel Loureiro and Alípio Mário Jorge},
  journal= {arXiv preprint arXiv:2210.06376},
  year   = {2022}
}