中文

数字人文领域的俄语数据集及其基于词嵌入的评测

计算与语言 2019-03-22 v1 机器学习 机器学习

摘要

在本文中,我们提出数字人文领域的俄语数据集,用于评测词嵌入技术或类似的语言建模与特征学习算法。这些数据集分为两类任务:词入侵与词类比,总共包含 31362 个任务单元。任务与数据集的特点是构建于小型、领域特定的语料库之上,且数据集中含有大量命名实体。这些数据集是为两部奇幻小说系列(《冰与火之歌》与《哈利·波特》)手动创建的。我们针对给定任务,使用在小说语料上训练的流行词嵌入模型,为数据集的俄语与英语版本提供基线评测。最后,我们比较并分析了结果,并讨论了俄语相对于该问题设定的特性。

关键词

引用

@article{arxiv.1903.08739,
  title  = {Russian Language Datasets in the Digitial Humanities Domain and Their Evaluation with Word Embeddings},
  author = {Gerhard Wohlgenannt and Artemii Babushkin and Denis Romashov and Igor Ukrainets and Anton Maskaykin and Ilya Shutov},
  journal= {arXiv preprint arXiv:1903.08739},
  year   = {2019}
}