切中要害:面向忠实且信息丰富的文本生成的对抗增强
计算与语言
2022-10-25 v1
摘要
尽管模型鲁棒性已在语言理解中得到广泛研究,Seq2Seq 生成的鲁棒性仍研究不足。本文对预训练 Seq2Seq 模型的鲁棒性进行了首次定量分析。我们发现,即便当前的 SOTA 预训练 Seq2Seq 模型(BART)仍然脆弱,这会导致文本生成任务在忠实性与信息丰富度上显著退化。这促使我们进一步提出一种新颖的对抗增强框架,即 AdvSeq,通过提升鲁棒性来普遍改善 Seq2Seq 模型的忠实性与信息丰富度。AdvSeq 在训练期间自动构建两类对抗增强样本:通过扰动词表示得到的隐式对抗样本,以及通过词语替换得到的显式对抗样本,二者均能有效提升 Seq2Seq 鲁棒性。在三个流行文本生成任务上的大量实验表明,AdvSeq 在自动与人工评测设置下均显著提升了 Seq2Seq 生成的忠实性与信息丰富度。
引用
@article{arxiv.2210.12367,
title = {Precisely the Point: Adversarial Augmentations for Faithful and Informative Text Generation},
author = {Wenhao Wu and Wei Li and Jiachen Liu and Xinyan Xiao and Sujian Li and Yajuan Lyu},
journal= {arXiv preprint arXiv:2210.12367},
year = {2022}
}
备注
EMNLP 2022 Main