中文

MELM:面向低资源命名实体识别的掩码实体语言建模数据增强

计算与语言 2022-03-21 v2

摘要

数据增强是低资源场景下数据稀缺的有效解决方案。然而,当应用于如 NER 这类 token 级任务时,数据增强方法常受 token-标签错位问题困扰,导致性能不佳。本工作中,我们提出掩码实体语言建模(MELM)作为一种面向低资源 NER 的新型数据增强框架。为缓解 token-标签错位问题,我们显式地将 NER 标签注入句子上下文,从而微调后的 MELM 能够通过显式以标签为条件来预测被掩码的实体 token。由此,MELM 生成带有新实体的高质量增强数据,提供丰富的实体规律知识并提升 NER 性能。当有多语言训练数据可用时,我们还将 MELM 与 code-mixing 结合以进一步提升效果。我们在不同低资源程度下的单语、跨语与多语 NER 上展示了 MELM 的有效性。实验结果表明,我们的 MELM 相较基线方法有明显提升。

关键词

引用

@article{arxiv.2108.13655,
  title  = {MELM: Data Augmentation with Masked Entity Language Modeling for Low-Resource NER},
  author = {Ran Zhou and Xin Li and Ruidan He and Lidong Bing and Erik Cambria and Luo Si and Chunyan Miao},
  journal= {arXiv preprint arXiv:2108.13655},
  year   = {2022}
}

备注

Accepted at ACL 2022