MELM:面向低资源命名实体识别的掩码实体语言建模数据增强
计算与语言
2022-03-21 v2
摘要
数据增强是低资源场景下数据稀缺的有效解决方案。然而,当应用于如 NER 这类 token 级任务时,数据增强方法常受 token-标签错位问题困扰,导致性能不佳。本工作中,我们提出掩码实体语言建模(MELM)作为一种面向低资源 NER 的新型数据增强框架。为缓解 token-标签错位问题,我们显式地将 NER 标签注入句子上下文,从而微调后的 MELM 能够通过显式以标签为条件来预测被掩码的实体 token。由此,MELM 生成带有新实体的高质量增强数据,提供丰富的实体规律知识并提升 NER 性能。当有多语言训练数据可用时,我们还将 MELM 与 code-mixing 结合以进一步提升效果。我们在不同低资源程度下的单语、跨语与多语 NER 上展示了 MELM 的有效性。实验结果表明,我们的 MELM 相较基线方法有明显提升。
引用
@article{arxiv.2108.13655,
title = {MELM: Data Augmentation with Masked Entity Language Modeling for Low-Resource NER},
author = {Ran Zhou and Xin Li and Ruidan He and Lidong Bing and Erik Cambria and Luo Si and Chunyan Miao},
journal= {arXiv preprint arXiv:2108.13655},
year = {2022}
}
备注
Accepted at ACL 2022