克罗地亚语词嵌入的评测
计算与语言
2017-11-09 v2
摘要
克罗地亚语是斯拉夫语族中资源匮乏且高度屈折的语言。当前研究多聚焦于英语。我们基于原始的英语Word2vec词类比语料库构建了新的词类比语料库,并加入了克罗地亚语的一些特定语言特征。接着,我们创建了克罗地亚语WordSim353与RG65语料库用于词相似度的基本评测。我们在两个流行的词表示模型上对比了所建语料库,模型分别基于Word2Vec工具与fastText工具。模型在13.7亿词元的训练语料上训练,并在一个新的鲁棒克罗地亚语词类比语料上测试。结果表明模型能够生成有意义的词表示。本研究显示,克罗地亚语的自由词序与较高形态复杂性影响了所得词嵌入的质量。
引用
@article{arxiv.1711.01804,
title = {Evaluation of Croatian Word Embeddings},
author = {Lukas Svoboda and Slobodan Beliga},
journal= {arXiv preprint arXiv:1711.01804},
year = {2017}
}
备注
In review process on LREC 2018 conference