俄语自然语言生成:语言建模数据集的构建与现代神经架构的评估
计算与语言
2020-05-07 v1 机器学习
摘要
生成连贯、语法正确且有意义的文本非常具有挑战性,然而它对许多现代 NLP 系统至关重要。迄今为止,研究主要聚焦于英语,对于其他语言,无论是标准化数据集还是使用最先进模型的实验都很少见。在这项工作中,我们 i) 提供了一个用于俄语语言建模的新基准数据集,ii) 使用流行的现代文本生成方法即变分自编码器和生成对抗网络(GAN)进行实验,我们在新数据集上训练了它们。我们依据困惑度、语法正确性和词汇多样性等指标对生成文本进行评估。
引用
@article{arxiv.2005.02470,
title = {Russian Natural Language Generation: Creation of a Language Modelling Dataset and Evaluation with Modern Neural Architectures},
author = {Zein Shaheen and Gerhard Wohlgenannt and Bassel Zaity and Dmitry Mouromtsev and Vadim Pak},
journal= {arXiv preprint arXiv:2005.02470},
year = {2020}
}