中文

词嵌入模型训练语料库的规模与结构:Araneum Russicum Maximum 与俄罗斯国家语料库

计算与语言 2018-01-22 v1

摘要

本文提出一个基于现有最大俄语语料库之一 Araneum Russicum Maximum(从网络爬取逾 100 亿词)训练的分布式词嵌入模型。我们将该模型与在俄罗斯国家语料库(RNC)上训练的模型进行比较。这两套语料库在规模与编纂方法上差异甚大。我们通过以多语言 SemSimLex999 语义相似度数据集的俄语部分评估所训模型来检验这些差异。我们检测并描述了该数据集中的诸多问题,并发布了修正后的新版本。除已为人知的 RNC 通常优于网络语料库这一事实外,我们列举并解释了模型在处理语义相似度任务时的细微差异、评测集中哪些部分对特定模型困难及其原因。此外,描述了两模型的训练学习曲线,表明 RNC 作为该任务的训练材料总体更为稳健。

关键词

引用

@article{arxiv.1801.06407,
  title  = {Size vs. Structure in Training Corpora for Word Embedding Models: Araneum Russicum Maximum and Russian National Corpus},
  author = {Andrey Kutuzov and Maria Kunilovskaya},
  journal= {arXiv preprint arXiv:1801.06407},
  year   = {2018}
}