他是在眨眼还是在点头?一个评估语言模型词语理解能力的挑战性基准
计算与语言
2021-02-09 v1
摘要
近期在大规模语料上预训练语言模型的进展在许多自然语言处理(NLP)任务上带来了巨大的性能提升。这些大型模型在预训练过程中获得了语言知识,从而通过微调提升下游任务的性能。为了评估获得了何种知识,通常通过以“填空”式完形填空问题查询语言模型来对其进行探测。现有的探测数据集主要关注词与实体之间的关系知识。我们提出 WDLMPro(Word Definition Language Model Probing,词语定义语言模型探测)以利用词语的词典定义直接评估词语理解能力。在我们的实验中,三个流行的预训练语言模型难以将词语与其定义相匹配。这表明它们对许多词语理解欠佳,且我们的新探测任务是一个艰巨的挑战,未来可有助于指导语言模型(LM)的研究。
引用
@article{arxiv.2102.03596,
title = {Does He Wink or Does He Nod? A Challenging Benchmark for Evaluating Word Understanding of Language Models},
author = {Lutfi Kerem Senel and Hinrich Schütze},
journal= {arXiv preprint arXiv:2102.03596},
year = {2021}
}
备注
5 pages, to appear in EACL 2021