中文

关于命名实体识别低资源领域数据增强技术的实验研究

计算与语言 2026-04-01 v1 信息检索 机器学习

摘要

命名实体识别(NER)是一种机器学习任务,通常依赖监督学习和已标注数据。获取此类数据常常是一个挑战,特别是在医疗、法律和金融等专业领域。这些领域常被称为低资源领域,由于数据稀缺,包含长尾实体。在此背景下,越来越多地被用于生成来自原始数据集的额外训练实例的数据增强技术。本研究评估了两种主要文本增强技术,即实体替换和上下文词替换,对两种广泛使用的NER模型(Bi-LSTM+CRF和BERT)的有效性。我们在四个来自低资源领域的数据集上进行实验,并探讨了各种训练子集大小和增强示例数量的影响。我们不仅确认数据增强特别适用于小型数据集,还展示了没有统一最佳的增强示例数量,即NER实践者必须实验不同的数量以微调其项目。

关键词

引用

@article{arxiv.2411.14551,
  title  = {An Experimental Study on Data Augmentation Techniques for Named Entity Recognition on Low-Resource Domains},
  author = {Arthur Elwing Torres and Edleno Silva de Moura and Altigran Soares da Silva and Mario A. Nascimento and Filipe Mesquita},
  journal= {arXiv preprint arXiv:2411.14551},
  year   = {2026}
}

备注

21 pages, 2 figures