基于提示排序的数据增强增强少样本命名实体识别
计算与语言
2023-05-22 v1
摘要
近来,数据增强(DA)方法已被证明在低资源设置下对预训练语言模型(PLM)有效,包括少样本命名实体识别(NER)。然而,传统的NER数据增强方法大多面向序列标注模型(即 token 级分类),很少能与统一自回归生成框架兼容,而后者可处理更广泛的NER任务,如嵌套NER。此外,这些生成框架有一个强假设,即实体在目标序列中会以与源序列相同的从左到右顺序出现。在本文中,我们指出无需保持这种严格顺序,在训练阶段可提供更多样化但合理的目标实体序列作为一种新颖的数据增强方法。然而,朴素地混合增强数据会混淆模型,因为一个源序列将对应不同的目标序列。因此,我们提出一种简单而有效的基于提示排序的数据增强(PODA)方法,以改进少样本NER场景下统一自回归生成框架的训练。在三个公开NER数据集上的实验结果及进一步分析证明了我们方法的有效性。
引用
@article{arxiv.2305.11791,
title = {Enhancing Few-shot NER with Prompt Ordering based Data Augmentation},
author = {Huiming Wang and Liying Cheng and Wenxuan Zhang and De Wen Soh and Lidong Bing},
journal= {arXiv preprint arXiv:2305.11791},
year = {2023}
}
备注
7 pages, 2 figures