中文

俄语自然语言生成:语言建模数据集的构建与现代神经架构的评估

计算与语言 2020-05-07 v1 机器学习

摘要

生成连贯、语法正确且有意义的文本非常具有挑战性,然而它对许多现代 NLP 系统至关重要。迄今为止,研究主要聚焦于英语,对于其他语言,无论是标准化数据集还是使用最先进模型的实验都很少见。在这项工作中,我们 i) 提供了一个用于俄语语言建模的新基准数据集,ii) 使用流行的现代文本生成方法即变分自编码器和生成对抗网络(GAN)进行实验,我们在新数据集上训练了它们。我们依据困惑度、语法正确性和词汇多样性等指标对生成文本进行评估。

关键词

引用

@article{arxiv.2005.02470,
  title  = {Russian Natural Language Generation: Creation of a Language Modelling Dataset and Evaluation with Modern Neural Architectures},
  author = {Zein Shaheen and Gerhard Wohlgenannt and Bassel Zaity and Dmitry Mouromtsev and Vadim Pak},
  journal= {arXiv preprint arXiv:2005.02470},
  year   = {2020}
}