并非古怪 vs. 绝对古怪:预训练语言模型中标量副词的研究
计算与语言
2023-10-24 v2
摘要
词义的向量空间模型都共享一个假设,即出现在相似上下文中的词具有相似的含义。在此类模型中,那些在主题关联上相似但在逻辑力度上不同的词往往作为语义相近的词出现,这给涉及逻辑推理的 NLP 应用带来了众所周知的挑战。现代预训练语言模型,如 BERT、RoBERTa 和 GPT-3,有望在逻辑任务上比经典静态词嵌入表现更好。然而,关于它们成功与否的报告褒贬不一。在本文中,我们通过对标量副词(一类未被充分探索且具有强逻辑力度的词)的系统性研究来推进这一讨论。利用涉及自然社交媒体数据和构造示例的三种不同任务,我们考察了 BERT、RoBERTa、GPT-2 和 GPT-3 在多大程度上展现出对这些常见词的类人通用知识。我们提出:1)这些模型是否能区分 MODALITY(情态)、FREQUENCY(频率)和 DEGREE(程度)这三个语义类别?2)它们是否隐式地表示了从最负到最正的完整量级?3)词频和上下文因素如何影响模型表现?我们发现,尽管捕获了逻辑含义的某些方面,这些模型的表现仍远不及人类。
引用
@article{arxiv.2305.16426,
title = {Not wacky vs. definitely wacky: A study of scalar adverbs in pretrained language models},
author = {Isabelle Lorge and Janet Pierrehumbert},
journal= {arXiv preprint arXiv:2305.16426},
year = {2023}
}
备注
Published in BlackBoxNLP workshop, EMNLP 2023