刻画众包数据中的差异性以训练生成风格多样输出的神经语言生成器
计算与语言
2018-09-17 v1
摘要
在对话系统中从意义表示进行端到端语言生成的最大挑战之一,是使输出更自然且多样。在此,我们采用餐厅领域包含 5 万条众包话语的大型语料库,并开发文本分析方法以系统性地刻画训练数据中句子的类型。随后我们自动标注训练数据,从而能够利用神经生成器开展两类实验。首先,我们测试以不同风格分区训练系统的效果,并量化更小但风格更可控的训练数据所带来的影响。其次,我们提出一种在训练中标注风格变体的方法,并展示可利用我们的风格标签修改生成话语的风格。我们对比并比较了这些可用于任何现有大型语料库的方法,展示了它们在语义质量与风格控制方面的差异。
引用
@article{arxiv.1809.05288,
title = {Characterizing Variation in Crowd-Sourced Data for Training Neural Language Generators to Produce Stylistically Varied Outputs},
author = {Juraj Juraska and Marilyn Walker},
journal= {arXiv preprint arXiv:1809.05288},
year = {2018}
}
备注
Accepted to INLG 2018