中文

PromptDA:面向基于提示的少样本学习器的标签引导数据增强

计算与语言 2023-03-24 v3 人工智能

摘要

大型预训练语言模型(PLM)的最新进展使其在任务特定微调的自然语言理解(NLU)任务上取得显著提升。然而,直接微调 PLM 严重依赖充足的标注训练样本,而这些样本通常难以获取。基于提示的 PLM 微调已证明对各类下游少样本任务十分有效。现有研究基于提示微调的少样本 NLU 任务主要聚焦于通过 verbalizer 推导合适的标签词或生成提示模板以激发 PLM 的语义。此外,诸如同义替换这类传统数据增强策略虽广泛用于低资源场景,但仅为基于提示的少样本学习带来边际提升。因此,一个重要研究问题浮现:如何为基于提示的少样本微调设计有效的数据增强方法?为此,考虑到标签语义在基于提示的微调中至关重要,我们提出一种新颖的标签引导数据增强框架 PromptDA,其利用丰富的标签语义信息进行数据增强。在少样本文本分类任务上的大量实验结果表明,该框架通过有效利用标签语义与数据增强在自然语言理解上具备优越性能。我们的代码已发布于 https://github.com/canyuchen/PromptDA。

关键词

引用

@article{arxiv.2205.09229,
  title  = {PromptDA: Label-guided Data Augmentation for Prompt-based Few-shot Learners},
  author = {Canyu Chen and Kai Shu},
  journal= {arXiv preprint arXiv:2205.09229},
  year   = {2023}
}

备注

Accepted to Proceedings of EACL 2023 main conference. Code is available at https://github.com/canyuchen/PromptDA