NeuroCounterfactuals:超越最小编辑反事实以实现更丰富的数据增强
计算与语言
2022-10-25 v1
摘要
尽管反事实数据增强为自然语言处理中的鲁棒泛化提供了一条有前景的途径,但生成一组能为模型提供有价值归纳偏置的反事实仍是一项挑战。大多数现有的反事实生成方法,无论是人工还是自动的,都依赖于通过最小编辑进行微小扰动,导致改动过于简单。我们提出了 NeuroCounterfactuals,其设计为松散反事实,允许更大的编辑幅度,从而生成包含语言多样性且与原始文档仍具相似性的自然化文本。我们新颖的生成方法将约束解码的优势与用于情感导向的语言模型适配优势相结合。使用我们的生成结果进行训练数据增强,在情感分类任务上取得了领域内和领域外的双重提升,在特定设置下甚至优于人工精心筛选的反事实。我们进一步给出详细分析,以展示 NeuroCounterfactuals 相较于仅涉及简单最小编辑方法的优势。
引用
@article{arxiv.2210.12365,
title = {NeuroCounterfactuals: Beyond Minimal-Edit Counterfactuals for Richer Data Augmentation},
author = {Phillip Howard and Gadi Singer and Vasudev Lal and Yejin Choi and Swabha Swayamdipta},
journal= {arXiv preprint arXiv:2210.12365},
year = {2022}
}
备注
Findings of EMNLP 2022