中文

SSMBA:基于自监督流形的数据增强以改善分布外鲁棒性

计算与语言 2020-10-06 v2 机器学习 机器学习

摘要

在训练域上表现良好的模型常常无法泛化到分布外(OOD)样本。数据增强是用于防止过拟合和改善 OOD 泛化的常用方法。然而,在自然语言中,难以生成停留在底层数据流形上的新样本。我们引入 SSMBA,一种通过使用一对腐蚀和重建函数在数据流形上随机移动来生成合成训练样本的数据增强方法。我们研究了 SSMBA 在自然语言域中的使用,利用流形假设以掩码语言模型重建被腐蚀的文本。在跨越 3 个任务和 9 个数据集的鲁棒性基准测试中,SSMBA 在域内和 OOD 数据上始终优于现有的数据增强方法和基线模型,在 OOD Amazon 评论上获得 0.8% 的准确率提升,在 OOD MNLI 上获得 1.8% 的准确率提升,在域内 IWSLT14 德英翻译上获得 1.4 BLEU 的提升。

关键词

引用

@article{arxiv.2009.10195,
  title  = {SSMBA: Self-Supervised Manifold Based Data Augmentation for Improving Out-of-Domain Robustness},
  author = {Nathan Ng and Kyunghyun Cho and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:2009.10195},
  year   = {2020}
}

备注

16 pages, 8 figures, to be published in EMNLP 2020