数字人文领域的俄语数据集及其基于词嵌入的评测
计算与语言
2019-03-22 v1 机器学习
机器学习
摘要
在本文中,我们提出数字人文领域的俄语数据集,用于评测词嵌入技术或类似的语言建模与特征学习算法。这些数据集分为两类任务:词入侵与词类比,总共包含 31362 个任务单元。任务与数据集的特点是构建于小型、领域特定的语料库之上,且数据集中含有大量命名实体。这些数据集是为两部奇幻小说系列(《冰与火之歌》与《哈利·波特》)手动创建的。我们针对给定任务,使用在小说语料上训练的流行词嵌入模型,为数据集的俄语与英语版本提供基线评测。最后,我们比较并分析了结果,并讨论了俄语相对于该问题设定的特性。
引用
@article{arxiv.1903.08739,
title = {Russian Language Datasets in the Digitial Humanities Domain and Their Evaluation with Word Embeddings},
author = {Gerhard Wohlgenannt and Artemii Babushkin and Denis Romashov and Igor Ukrainets and Anton Maskaykin and Ilya Shutov},
journal= {arXiv preprint arXiv:1903.08739},
year = {2019}
}