中文

AStitchInLanguageModels: 探索预训练语言模型中习语性的数据集与方法

计算与语言 2021-09-10 v1

摘要

尽管预训练语言模型在多种 NLP 任务中取得了成功,但由于严重依赖组合性,它们无法有效捕捉多词表达(MWEs)的含义,尤其是习语。因此,亟需用于改进 MWE 表示的数据集和方法。现有数据集仅限于提供表达的习语性程度以及 MWE 的字面解释和(在适用情况下的)单一非字面解释。本工作提出了一个新颖的、包含自然出现句子的数据集,这些句子中的 MWE 被人工分类为细粒度的含义集合,涵盖英语和葡萄牙语。我们将此数据集用于两个任务,旨在测试: i) 语言模型检测习语用法的能力,以及 ii) 语言模型在生成包含习语的句子表示方面的有效性。我们的实验表明,在检测习语用法的任务上,这些模型在 one-shot 和 few-shot 场景下表现尚可,但在 zero-shot 场景下仍有很大的改进空间。在习语性表示任务上,我们发现预训练并不总是有效的,而微调可以提供一种样本高效的、学习包含 MWE 的句子表示的方法。

关键词

引用

@article{arxiv.2109.04413,
  title  = {AStitchInLanguageModels: Dataset and Methods for the Exploration of Idiomaticity in Pre-Trained Language Models},
  author = {Harish Tayyar Madabushi and Edward Gow-Smith and Carolina Scarton and Aline Villavicencio},
  journal= {arXiv preprint arXiv:2109.04413},
  year   = {2021}
}

备注

Findings of EMNLP 2021. Code available at: https://github.com/H-TayyarMadabushi/AStitchInLanguageModels