中文

用于命名实体识别的句法驱动数据增强

计算与语言 2022-10-04 v2 人工智能 机器学习

摘要

在低资源场景下,常利用数据增强策略来提升性能。众多方法尝试了文档级增强(如文本分类),但极少有研究探索 token 级增强。若朴素执行,数据增强会产生语义不一致且不合语法的样本。本工作中,我们比较了简单的掩码语言模型替换和一种使用成分树变异的增强方法,旨在低资源场景下提升命名实体识别性能,同时保持增强句子的语言连贯性。

关键词

引用

@article{arxiv.2208.06957,
  title  = {Syntax-driven Data Augmentation for Named Entity Recognition},
  author = {Arie Pratama Sutiono and Gus Hahn-Powell},
  journal= {arXiv preprint arXiv:2208.06957},
  year   = {2022}
}

备注

submitted to Pattern-based Approaches to NLP in the Age of Deep Learning 2022 (Pan-DL 2022)