ACLM:一种基于选择性去噪的生成式数据增强方法用于低资源复杂 NER
计算与语言
2023-06-02 v1 人工智能
信息检索
摘要
复杂命名实体识别(NER)是在低上下文文本中检测语言上复杂的命名实体的任务。本文中,我们提出 ACLM(Attention-map aware keyword selection for Conditional Language Model fine-tuning,基于条件语言模型微调的注意力图感知关键词选择),一种基于条件生成的新型数据增强方法,以解决低资源复杂 NER 中的数据稀缺问题。ACLM 缓解了上下文-实体失配问题——现有 NER 数据增强技术常受累于此,并因将复杂命名实体置于错误上下文而生成不连贯的增强样本。ACLM 构建于 BART 之上,并在新颖的文本重建或去噪任务上优化:我们利用选择性掩码(由注意力图辅助)以保留输入句中提供上下文相关附加知识或实体线索的命名实体与特定关键词。相较其他数据增强策略,ACLM 能生成更多样且连贯的增强样本,并保留句中复杂实体的真实词义。我们在单语、跨语与多语复杂 NER 的多种低资源设定下从定性与定量两方面证明了 ACLM 的有效性。ACLM 以显著优势(1%–36%)超越所有神经基线。此外,我们展示了 ACLM 对其他受数据稀缺困扰领域(如生物医学)的应用。实践中,ACLM 为这些领域生成比先前方法更有效且事实性的增强样本。代码:https://github.com/Sreyan88/ACLM
引用
@article{arxiv.2306.00928,
title = {ACLM: A Selective-Denoising based Generative Data Augmentation Approach for Low-Resource Complex NER},
author = {Sreyan Ghosh and Utkarsh Tyagi and Manan Suri and Sonal Kumar and S Ramaneswaran and Dinesh Manocha},
journal= {arXiv preprint arXiv:2306.00928},
year = {2023}
}
备注
ACL 2023 Main Conference