基于迭代文本编辑的数据到文本生成
计算与语言
2021-01-29 v2
摘要
我们提出了一种基于迭代文本编辑的数据到文本生成新方法。我们的方法在最大化输出文本的完备性与语义准确性的同时,利用近期预训练文本编辑模型(LaserTagger)与语言建模模型(GPT-2)的能力来改善文本流畅度。为此,我们首先使用平凡模板将数据项转换为文本,然后由为句子融合任务训练的神经网络模型迭代改进所得文本。模型输出由简单启发式过滤,并用现成预训练语言模型重排序。我们在两个主要数据到文本数据集(WebNLG、Cleaned E2E)上评估了我们的方法,并分析了其缺陷与益处。此外,我们展示了我们对数据到文本生成的表述开启了使用通用领域句子融合数据集进行零样本领域自适应的可能性。
引用
@article{arxiv.2011.01694,
title = {Data-to-Text Generation with Iterative Text Editing},
author = {Zdeněk Kasner and Ondřej Dušek},
journal= {arXiv preprint arXiv:2011.01694},
year = {2021}
}
备注
Accepted for INLG 2020