日语词相似度数据集的构建
计算与语言
2018-02-23 v2
摘要
分布式词表示的评价通常通过词相似度任务和/或词类比任务进行。英语中已有许多现成的此类数据集。然而,对于缺乏此类资源的语言(如日语),评价分布式表示十分困难。因此,作为评价日语分布式表示的第一步,我们构建了一个日语词相似度数据集。据我们所知,该数据集是首个可用于评价日语分布式表示的资源。此外,我们的数据集包含多种词性,除常用词外还收录了稀有词。
引用
@article{arxiv.1703.05916,
title = {Construction of a Japanese Word Similarity Dataset},
author = {Yuya Sakaizawa and Mamoru Komachi},
journal= {arXiv preprint arXiv:1703.05916},
year = {2018}
}
备注
LREC 2018; 4 pages