中文

Multi-SimLex:面向多语言与跨语言词汇语义相似性的大规模评测资源

计算与语言 2020-03-11 v1

摘要

我们介绍了 Multi-SimLex,一个大规模词汇资源与评测基准,涵盖 12 种类型学上多样的语言的数据集,包括主要语言(如普通话中文、西班牙语、俄语)以及资源较少的语言(如威尔士语、斯瓦希里语)。每种语言数据集都标注了语义相似性这一词汇关系,包含 1,888 个语义对齐的概念对,对词类(名词、动词、形容词、副词)、词频等级、相似度区间、词汇场以及具体性水平提供了代表性覆盖。此外,由于概念在各语言间对齐,我们提供了一套 66 个跨语言语义相似性数据集。凭借其庞大的规模与语言覆盖,Multi-SimLex 为实验评测与分析提供了全新的机会。在其单语与跨语言基准上,我们评测并分析了大量近期最先进的单语与跨语言表示模型,包括静态与上下文词嵌入(如 fastText、M-BERT 和 XLM)、外部注入的词汇表示,以及完全无监督与(弱)监督跨语言词嵌入。我们还提出了一套逐步的数据集创建协议,用于为更多语言创建一致的、Multi-SimLex 风格的资源。我们这些贡献——Multi-SimLex 数据集的公开发布、其创建协议、强基线结果,以及有助于指导多语言词汇语义与表示学习未来发展的深入分析——均通过一个网站提供,以鼓励社区进一步将 Multi-SimLex 扩展至更多语言。如此大规模的语义资源可启发 NLP 跨语言的显著进一步进展。

关键词

引用

@article{arxiv.2003.04866,
  title  = {Multi-SimLex: A Large-Scale Evaluation of Multilingual and Cross-Lingual Lexical Semantic Similarity},
  author = {Ivan Vulić and Simon Baker and Edoardo Maria Ponti and Ulla Petti and Ira Leviant and Kelly Wing and Olga Majewska and Eden Bar and Matt Malone and Thierry Poibeau and Roi Reichart and Anna Korhonen},
  journal= {arXiv preprint arXiv:2003.04866},
  year   = {2020}
}

备注

Data and guidelines available at https://multisimlex.com/