中文

SeqMix:通过序列混合增强主动序列标注

计算与语言 2020-10-07 v1 机器学习

摘要

主动学习是低资源序列标注任务的一项重要技术。然而,当前的主动序列标注方法在每次迭代中仅使用被查询的样本,这是一种低效利用人工标注的方式。我们提出一种简单而有效的数据增强方法,以提升主动序列标注的标注效率。我们的方法 SeqMix 在每次迭代中通过生成额外的带标签序列来增广被查询的样本。关键难点在于生成合理的序列及词元级标签。在 SeqMix 中,我们通过对被查询样本的序列与词元级标签执行 mixup 来解决该挑战。此外,我们在序列混合过程中设计了一个判别器,用于判断生成的序列是否合理。我们在命名实体识别与事件检测任务上的实验表明,SeqMix 在 F1F_1 分数上可比标准主动序列标注方法提升 2.27%2.27\%--3.75%3.75\%。SeqMix 的代码与数据见 https://github.com/rz-zhang/SeqMix。

关键词

引用

@article{arxiv.2010.02322,
  title  = {SeqMix: Augmenting Active Sequence Labeling via Sequence Mixup},
  author = {Rongzhi Zhang and Yue Yu and Chao Zhang},
  journal= {arXiv preprint arXiv:2010.02322},
  year   = {2020}
}

备注

EMNLP 2020 Long Paper