基于实体到文本的各类命名实体识别任务数据增强方法
计算与语言
2023-05-29 v2 人工智能
摘要
数据增强技术已被用于缓解各类 NER 任务(扁平、嵌套和不连续 NER 任务)中标注数据稀缺的问题。现有的增强技术要么操纵原始文本中的词语从而破坏文本的语义连贯性,要么利用生成模型而忽略保留原始文本中的实体,这阻碍了增强技术在嵌套和不连续 NER 任务上的使用。在本工作中,我们提出一种新颖的基于实体到文本的数据增强技术 EnTDA,用于在原始文本的实体列表中进行实体的添加、删除、替换或交换,并采用这些增强后的实体列表来生成语义连贯且保留实体的文本,以用于各类 NER 任务。此外,我们引入一种多样性束搜索以提高文本生成过程中的多样性。在跨越三种任务(扁平、嵌套和不连续 NER 任务)和两种设定(全数据与低资源设定)的十三个 NER 数据集上的实验表明,与基线增强技术相比,EnTDA 能带来更大的性能提升。
引用
@article{arxiv.2210.10343,
title = {Entity-to-Text based Data Augmentation for various Named Entity Recognition Tasks},
author = {Xuming Hu and Yong Jiang and Aiwei Liu and Zhongqiang Huang and Pengjun Xie and Fei Huang and Lijie Wen and Philip S. Yu},
journal= {arXiv preprint arXiv:2210.10343},
year = {2023}
}
备注
Accepted to ACL 2023 (Findings), Long Paper, 14 pages