中文

潜在习语表达(PIE)-英语:带习语类别的语料库

计算与语言 2022-04-26 v2 机器学习

摘要

我们提出了一个相当大规模的英语潜在习语表达(PIE)数据集,用于自然语言处理(NLP)。在机器翻译(MT)、词义消歧(WSD)和信息检索等任务中,NLP 系统面临的挑战使得拥有一个带有类别标注的习语数据集(如本工作所示)成为必要。据作者所知,这是首个超越字面与通用习语分类、带有习语类别的习语语料库。具体而言,数据集中标注了以下类别:隐喻、明喻、委婉语、排比、拟人、矛盾修辞、悖论、夸张、反讽和字面。我们获得了两名独立标注者之间 88.89% 的总体标注者间一致性(IAA)分数。许多过往工作受限于语料规模与样本类别,而本数据集包含超过 20,100 个样本,其中有来自 10 个类别(或义项)的近 1,200 个习语实例(含其含义)。该语料库也可由研究者扩展以满足特定需求。语料库带有来自 NLTK 库的词性(PoS)标注。在语料库上进行的分类实验为获取基线并在三种常见模型(包括 BERT 模型)间进行比较,取得了良好结果。我们还公开了该语料库及用于处理它的相关代码,以供 NLP 任务使用。

关键词

引用

@article{arxiv.2105.03280,
  title  = {Potential Idiomatic Expression (PIE)-English: Corpus for Classes of Idioms},
  author = {Tosin P. Adewumi and Roshanak Vadoodi and Aparajita Tripathy and Konstantina Nikolaidou and Foteini Liwicki and Marcus Liwicki},
  journal= {arXiv preprint arXiv:2105.03280},
  year   = {2022}
}

备注

Accepted at the International Conference on Language Resources and Evaluation (LREC) 2022