基于数据增强的序列到序列预训练用于句子重写
计算与语言
2019-09-23 v2
摘要
我们研究用于句子重写的序列到序列(seq2seq)预训练与数据增强。我们并未同时使用黄金训练数据与增强数据训练seq2seq模型,而是将其分离在不同阶段训练:用增强数据预训练,用黄金数据微调。我们还引入了多种数据增强方法以辅助句子重写的模型预训练。我们在两个典型的界定清晰的句子重写任务中评估了我们的方法:语法错误纠正(GEC)与正式性风格转换(FST)。实验表明,我们的方法能更好地利用增强数据而不损害模型对黄金数据的信任,并通过我们提出的数据增强方法进一步提升模型性能。我们的方法在公认的GEC与FST句子重写基准上大幅推进了最先进(state-of-the-art)结果。具体而言,在受限训练设定下,它将CoNLL-2014基准的分数与JFLEG测试GLEU分数分别推至62.61与63.54,在非受限设定下分别为66.77与65.22,并将GYAFC基准的BLEU在E&M域推至74.24(绝对提升2.23),在F&R域推至77.97(绝对提升2.64)。
引用
@article{arxiv.1909.06002,
title = {Sequence-to-sequence Pre-training with Data Augmentation for Sentence Rewriting},
author = {Yi Zhang and Tao Ge and Furu Wei and Ming Zhou and Xu Sun},
journal= {arXiv preprint arXiv:1909.06002},
year = {2019}
}