中文

基于语言模型文本增强的神经数据到文本生成

计算与语言 2021-02-09 v1

摘要

对于许多新的数据到文本生成应用领域,训练神经模型的主要障碍在于缺乏训练数据。虽然数据侧通常可获得大量实例,但文本样本往往只有极少数量。为解决此问题,我们在此提出一种适用于该场景的新颖少样本方法。我们的方法通过以下方式自动增强可用于训练的数据:(i) 基于将特定值替换为同一类别中的替代值来生成新文本样本,(ii) 基于GPT-2生成新文本样本,(iii) 提出一种将新文本样本与数据样本配对的自动方法。由于文本增强可能给训练数据引入噪声,我们使用循环一致性作为目标,以确保给定数据样本在表述为文本后能被正确重建(且文本样本能从数据重建)。在E2E和WebNLG两个基准上,我们表明这种弱监督训练范式能够以少于10%的标注量优于全监督seq2seq模型。通过利用所有标注数据,我们的模型能将标准seq2seq模型的性能提升超过5个BLEU点,在两个数据集上均确立了新的state-of-the-art。

关键词

引用

@article{arxiv.2102.03556,
  title  = {Neural Data-to-Text Generation with LM-based Text Augmentation},
  author = {Ernie Chang and Xiaoyu Shen and Dawei Zhu and Vera Demberg and Hui Su},
  journal= {arXiv preprint arXiv:2102.03556},
  year   = {2021}
}

备注

Accepted EACL 2021