筛选与生成:面向神经自然语言生成中语义与风格联合控制的语料库与方法
计算与语言
2019-06-18 v2
摘要
近年来,从结构化意义表示进行神经自然语言生成(NNLG)日益流行。尽管我们在生成保留语义且句法正确的话语方面取得了进展,但 NNLG 系统的各种缺陷依然明显:新任务需要新的训练数据,而这些数据难以获取或不易直接获得;且模型输出简单,可能枯燥且重复。本文通过以下两点解决 NNLG 中这两个关键挑战:(1)利用免费可用且天然具有描述性的用户评论数据,可扩展地(且零成本)创建带有丰富风格标记的并行意义表示与参考文本的训练数据集;(2)系统性地探索风格标记如何实现神经模型输出在语义与风格方面的联合控制。我们提出 YelpNLG,一个包含 300,000 条丰富并行意义表示以及涵盖不同餐厅属性、风格高度多变的参考文本的语料库,并描述了一种可扩展复用于其他领域 NLG 数据集生成的新方法。实验表明,模型能控制重要方面,包括形容词的词汇选择、输出长度和情感,使模型在不牺牲语义的前提下成功命中多个风格目标。
引用
@article{arxiv.1906.01334,
title = {Curate and Generate: A Corpus and Method for Joint Control of Semantics and Style in Neural NLG},
author = {Shereen Oraby and Vrindavan Harrison and Abteen Ebrahimi and Marilyn Walker},
journal= {arXiv preprint arXiv:1906.01334},
year = {2019}
}
备注
To appear at ACL 19. 9 content pages, 3 appendix pages