中文

SpaDeLeF:用于西班牙语搭配词汇函数层次分类的数据集

计算与语言 2023-11-08 v1

摘要

在自然语言处理(NLP)中,词汇函数是一个用于无歧义表示文本中词与短语语义和句法特征的概念,最初在意义文本理论中提出。词汇函数的层次分类涉及将这些特征组织为树状的类别或标签层次结构。这是一项具有挑战性的任务,因为它需要良好理解文本中词与短语的上下文及相互关系。它还需要大量标注数据来有效训练语言模型。在本文中,我们提出了一个由最频繁的西班牙语动名词搭配及出现它们的句子组成的数据集,每个搭配被分配给 37 个定义为层次分类任务类别的词汇函数之一。每个类别表示搭配中名词与动词之间涉及其语义和句法特征的关系。我们将这些类别组合为基于树的结构,并引入该结构每一层的分类目标。该数据集通过依存树解析和西班牙语新闻中短语的匹配创建。我们为每个目标提供了基线和数据划分。

关键词

引用

@article{arxiv.2311.04189,
  title  = {SpaDeLeF: A Dataset for Hierarchical Classification of Lexical Functions for Collocations in Spanish},
  author = {Yevhen Kostiuk and Grigori Sidorov and Olga Kolesnikova},
  journal= {arXiv preprint arXiv:2311.04189},
  year   = {2023}
}