中文

面向常识推理的生成式数据增强

计算与语言 2022-08-09 v3

摘要

常识推理的最新进展依赖于大规模人工标注训练数据以达到峰值性能。然而,训练样本的手动整理成本高昂,且已被证明会引入神经网络可轻易利用并过拟合的标注伪迹。我们研究 G-DAUG^C,一种新颖的生成式数据增强方法,旨在低资源设置下实现更准确和鲁棒的学习。我们的方法使用预训练语言模型生成合成样本,并挑选出信息量最大且最多样的样本集用于数据增强。在多个常识推理基准的实验中,G-DAUG^C 持续优于基于回译的现有数据增强方法,并在 WinoGrande、CODAH 和 CommonsenseQA 上确立了新的 SOTA。此外,除了分布内准确率的提升,G-DAUG^C 增强的训练还增强了分布外泛化,对对抗或扰动样本表现出更强的鲁棒性。我们的分析表明 G-DAUG^C 产生多样且流畅的训练样本,且其选择和训练方法对性能很重要。我们的发现鼓励未来研究朝向生成式数据增强,以增强分布内学习与分布外泛化。

关键词

引用

@article{arxiv.2004.11546,
  title  = {Generative Data Augmentation for Commonsense Reasoning},
  author = {Yiben Yang and Chaitanya Malaviya and Jared Fernandez and Swabha Swayamdipta and Ronan Le Bras and Ji-Ping Wang and Chandra Bhagavatula and Yejin Choi and Doug Downey},
  journal= {arXiv preprint arXiv:2004.11546},
  year   = {2022}
}

备注

Findings of the Association for Computational Linguistics: EMNLP 2020