中文

CoSimLex:一种用于评估上下文中分级词相似度的资源

计算与语言 2020-10-30 v3

摘要

最先进的自然语言处理工具构建于上下文相关的词嵌入之上,但目前不存在评估这些表示的直接方法。用于嵌入内在评估的标准任务和数据集基于相似度判断,但忽略上下文;用于词义消歧的标准任务考虑上下文但不提供意义的连续相似度度量。本文描述了构建新数据集 CoSimLex 以填补此空白的努力。它建立在 SimLex-999 的标准成对相似度任务之上,提供上下文相关的相似度度量;不仅涵盖词义的离散差异,也涵盖更细微、分级的意义变化;不仅涵盖资源充足的语言(英语),也涵盖若干资源较少的语言。我们定义了任务与评估指标,概述了数据集收集方法,并描述了该数据集目前的状况。

关键词

引用

@article{arxiv.1912.05320,
  title  = {CoSimLex: A Resource for Evaluating Graded Word Similarity in Context},
  author = {Carlos Santos Armendariz and Matthew Purver and Matej Ulčar and Senja Pollak and Nikola Ljubešić and Marko Robnik-Šikonja and Mark Granroth-Wilding and Kristiina Vaik},
  journal= {arXiv preprint arXiv:1912.05320},
  year   = {2020}
}