中文

用于零样本数据到文本生成的神经流水线

计算与语言 2022-03-31 v1

摘要

在数据到文本(D2T)生成中,在域内数据上训练会导致对数据表示的过拟合以及训练数据噪声的重复。我们考察如何避免对预训练语言模型(PLM)在 D2T 生成数据集上微调,同时仍利用 PLM 的表面实现能力。受流水线方法启发,我们提出通过对单项描述进行变换来生成文本,所用的是在通用领域基于文本的操作上训练的一组模块:排序、聚合与段落压缩。我们在由英文维基百科构建的合成语料 WikiFluent 上训练 PLM 执行这些操作。我们在两个主要的三元组到文本数据集——WebNLG 与 E2E——上的实验表明,我们的方法能够在零样本设定下从 RDF 三元组实现 D2T 生成。

关键词

引用

@article{arxiv.2203.16279,
  title  = {Neural Pipeline for Zero-Shot Data-to-Text Generation},
  author = {Zdeněk Kasner and Ondřej Dušek},
  journal= {arXiv preprint arXiv:2203.16279},
  year   = {2022}
}

备注

Accepted to ACL 2022 Main Conference