中文

RoPDA:面向低资源命名实体识别的鲁棒基于提示的数据增强

计算与语言 2023-07-18 v2 人工智能

摘要

数据增强已被广泛用于低资源 NER 任务中以解决数据稀疏问题。然而,以往的数据增强方法存在句法结构被破坏、词符-标签不匹配以及需要外部知识或人工干预等缺点。为解决这些问题,我们提出面向低资源 NER 的鲁棒基于提示的数据增强(RoPDA)。基于具有连续提示的预训练语言模型(PLMs),RoPDA 通过五种基础增强操作执行实体增强与上下文增强,以生成标签翻转与标签保留样本。为优化增强样本的使用,我们提出两种技术:自一致性过滤(Self-Consistency Filtering)与 mixup。前者有效剔除低质量样本,后者防止直接使用标签翻转样本导致的性能下降。在来自不同领域的三个基准上的大量实验表明,RoPDA 显著优于强基线,并且在引入未标注数据时也优于最先进的半监督学习方法。

关键词

引用

@article{arxiv.2307.07417,
  title  = {RoPDA: Robust Prompt-based Data Augmentation for Low-Resource Named Entity Recognition},
  author = {Sihan Song and Furao Shen and Jian Zhao},
  journal= {arXiv preprint arXiv:2307.07417},
  year   = {2023}
}