基于渐进编辑的高召回数据到文本生成
计算与语言
2022-08-10 v1 人工智能
摘要
数据到文本 (Data-to-text, D2T) 生成是从结构化输入生成文本的任务。我们观察到,当同一目标句被重复两次时,基于 Transformer (T5) 的模型会从结构化输入生成由不对称句子组成的输出。换言之,这些句子在长度和质量上均不同。我们称此现象为“非对称生成 (Asymmetric Generation)”并将其用于 D2T 生成。一旦生成非对称句子,我们便将输出的第一部分与无重复目标相加。随着其经历渐进编辑 (ProEdit),召回率得以提升。因此,该方法比编辑前更好地覆盖了结构化输入。ProEdit 是一种简单而有效的提升 D2T 生成性能的方法,并在 ToTTo 数据集上取得了新的最优 (state-of-the-art) 结果。
引用
@article{arxiv.2208.04558,
title = {High Recall Data-to-text Generation with Progressive Edit},
author = {Choonghan Kim and Gary Geunbae Lee},
journal= {arXiv preprint arXiv:2208.04558},
year = {2022}
}