中文

通过联合学习自然语言生成与自然语言理解模型的半监督神经文本生成

计算与语言 2019-10-09 v1

摘要

在自然语言生成(Natural Language Generation, NLG)中,通过深度学习训练的端到端(End-to-End, E2E)系统近来受到强烈关注。此类深度模型需要大量精细标注数据才能达到令人满意的性能。然而,为每个新 NLG 应用获取这样的数据集是一项繁琐且耗时的任务。本文提出一种半监督深度学习方案,可在有非标注数据与(可用时的)标注数据时从中学习。它使用 NLG 与自然语言理解(Natural Language Understanding, NLU)序列到序列模型,二者联合学习以弥补标注的不足。在两个基准数据集上的实验表明,在标注数据有限的情况下,该方法可达到极具竞争力的结果,且未使用任何预处理或重打分技巧。这些发现为利用非标注数据集开辟了道路,而后者正是当前 E2E NLG 系统向新应用拓展的瓶颈。

关键词

引用

@article{arxiv.1910.03484,
  title  = {Semi-Supervised Neural Text Generation by Joint Learning of Natural Language Generation and Natural Language Understanding Models},
  author = {Raheel Qader and François Portet and Cyril Labbé},
  journal= {arXiv preprint arXiv:1910.03484},
  year   = {2019}
}