PromDA:面向低资源 NLU 任务的基于提示的数据增强
计算与语言
2022-03-18 v2
摘要
本文关注低资源自然语言理解(NLU)任务的数据增强。我们提出基于提示的数据增强模型(PromDA),其仅在冻结的预训练语言模型(PLMs)中训练小规模的软提示(即一组可训练向量)。这避免了收集未标注领域内数据的人力投入,并保持了生成合成数据的质量。此外,PromDA 通过两种不同视角生成合成数据,并使用 NLU 模型过滤低质量数据。在四个基准上的实验表明,PromDA 产生的合成数据成功提升了 NLU 模型的性能,持续优于若干竞争性基线模型,包括使用未标注领域内数据的最先进半监督模型。PromDA 的合成数据也与未标注领域内数据互补。当二者结合训练时,NLU 模型可进一步提升。
引用
@article{arxiv.2202.12499,
title = {PromDA: Prompt-based Data Augmentation for Low-Resource NLU Tasks},
author = {Yufei Wang and Can Xu and Qingfeng Sun and Huang Hu and Chongyang Tao and Xiubo Geng and Daxin Jiang},
journal= {arXiv preprint arXiv:2202.12499},
year = {2022}
}
备注
Accepted to ACL 2022 Main Conference, Camera-Ready Version