中文

风格迁移作为数据增强:以命名实体识别为例

计算与语言 2022-10-17 v1

摘要

在这项工作中,我们以英语命名实体识别任务为案例,探索将风格迁移作为数据增强方法,以在低资源场景下增加训练数据的规模与多样性。我们提出一种新方法,通过更改文本的风格相关属性,将其从高质量资源域有效转换至低资源域,从而生成用于训练的的合成数据。此外,我们设计了一种约束解码算法及一组用于数据选择的关键要素,以保证生成有效且连贯的数据。在五种不同域对及不同数据规模下的实验与分析表明,与当前最先进的数据增强方法相比,我们的方法能显著提升效果。我们的方法是解决数据稀缺的实用方案,并期望其可应用于其他 NLP 任务。

关键词

引用

@article{arxiv.2210.07916,
  title  = {Style Transfer as Data Augmentation: A Case Study on Named Entity Recognition},
  author = {Shuguang Chen and Leonardo Neves and Thamar Solorio},
  journal= {arXiv preprint arXiv:2210.07916},
  year   = {2022}
}

备注

To appear at EMNLP 2022 main conference