中文

日语词相似度数据集的构建

计算与语言 2018-02-23 v2

摘要

分布式词表示的评价通常通过词相似度任务和/或词类比任务进行。英语中已有许多现成的此类数据集。然而,对于缺乏此类资源的语言(如日语),评价分布式表示十分困难。因此,作为评价日语分布式表示的第一步,我们构建了一个日语词相似度数据集。据我们所知,该数据集是首个可用于评价日语分布式表示的资源。此外,我们的数据集包含多种词性,除常用词外还收录了稀有词。

关键词

引用

@article{arxiv.1703.05916,
  title  = {Construction of a Japanese Word Similarity Dataset},
  author = {Yuya Sakaizawa and Mamoru Komachi},
  journal= {arXiv preprint arXiv:1703.05916},
  year   = {2018}
}

备注

LREC 2018; 4 pages