中文

PromDA:面向低资源 NLU 任务的基于提示的数据增强

计算与语言 2022-03-18 v2

摘要

本文关注低资源自然语言理解(NLU)任务的数据增强。我们提出基于提示的数据增强模型(PromDA),其仅在冻结的预训练语言模型(PLMs)中训练小规模的软提示(即一组可训练向量)。这避免了收集未标注领域内数据的人力投入,并保持了生成合成数据的质量。此外,PromDA 通过两种不同视角生成合成数据,并使用 NLU 模型过滤低质量数据。在四个基准上的实验表明,PromDA 产生的合成数据成功提升了 NLU 模型的性能,持续优于若干竞争性基线模型,包括使用未标注领域内数据的最先进半监督模型。PromDA 的合成数据也与未标注领域内数据互补。当二者结合训练时,NLU 模型可进一步提升。

关键词

引用

@article{arxiv.2202.12499,
  title  = {PromDA: Prompt-based Data Augmentation for Low-Resource NLU Tasks},
  author = {Yufei Wang and Can Xu and Qingfeng Sun and Huang Hu and Chongyang Tao and Xiubo Geng and Daxin Jiang},
  journal= {arXiv preprint arXiv:2202.12499},
  year   = {2022}
}

备注

Accepted to ACL 2022 Main Conference, Camera-Ready Version