中文

胡言语义学:俄罗斯语 Twitter 在词义相似度任务上表现如何?

计算与语言 2016-03-01 v1

摘要

最受关注且最成功的语言模型主要是为英语和其他相近的欧洲语言(如法语、德语等)开发和评估的。研究这些模型对其他语言的适用性十分重要。最近,针对俄语的向量空间模型已在多个语料库(如 Wikipedia、RuWac、lib.ru)中得到研究。这些模型通过词义相似度任务进行了评估。据我们所知,Twitter 尚未作为该任务的语料库被考虑,我们通过本工作填补了这一空白。在 Twitter 语料库上训练的向量结果在准确率上与其他单语料库训练的模型相当,尽管目前最佳性能是通过多语料库组合实现的。

关键词

引用

@article{arxiv.1602.08741,
  title  = {Gibberish Semantics: How Good is Russian Twitter in Word Semantic Similarity Task?},
  author = {Nikolay N. Vasiliev},
  journal= {arXiv preprint arXiv:1602.08741},
  year   = {2016}
}