BLISS:基于自监督输入表示的鲁棒序列到序列学习
计算与语言
2022-04-26 v2
摘要
数据增强(DA)是在各类自然语言处理(NLP)任务上实现鲁棒序列到序列学习的核心。然而,大多数 DA 方法迫使解码器基于受扰动的输入表示进行预测,未能充分利用受扰动输入所提供的监督信息。本文中,我们提出一种框架级的鲁棒序列到序列学习方法 BLISS,通过自监督输入表示,具有补充数据级增强方法的巨大潜力。其关键思想是用监督("输入→输出")和自监督("受扰动输入→输入")两类信息共同监督序列到序列框架。我们进行了全面实验,在机器翻译、语法错误纠正和文本摘要等任务上验证 BLISS 的有效性。结果表明,BLISS 显著优于原始 Transformer,且相较于其他五个对比基线在各任务上表现稳定。大量分析揭示 BLISS 学到了鲁棒的表示和丰富的语言知识,证实了我们的主张。源代码将在发表后公开。
引用
@article{arxiv.2204.07837,
title = {BLISS: Robust Sequence-to-Sequence Learning via Self-Supervised Input Representation},
author = {Zheng Zhang and Liang Ding and Dazhao Cheng and Xuebo Liu and Min Zhang and Dacheng Tao},
journal= {arXiv preprint arXiv:2204.07837},
year = {2022}
}