SeqMix:通过序列混合增强主动序列标注
计算与语言
2020-10-07 v1 机器学习
摘要
主动学习是低资源序列标注任务的一项重要技术。然而,当前的主动序列标注方法在每次迭代中仅使用被查询的样本,这是一种低效利用人工标注的方式。我们提出一种简单而有效的数据增强方法,以提升主动序列标注的标注效率。我们的方法 SeqMix 在每次迭代中通过生成额外的带标签序列来增广被查询的样本。关键难点在于生成合理的序列及词元级标签。在 SeqMix 中,我们通过对被查询样本的序列与词元级标签执行 mixup 来解决该挑战。此外,我们在序列混合过程中设计了一个判别器,用于判断生成的序列是否合理。我们在命名实体识别与事件检测任务上的实验表明,SeqMix 在 分数上可比标准主动序列标注方法提升 --。SeqMix 的代码与数据见 https://github.com/rz-zhang/SeqMix。
引用
@article{arxiv.2010.02322,
title = {SeqMix: Augmenting Active Sequence Labeling via Sequence Mixup},
author = {Rongzhi Zhang and Yue Yu and Chao Zhang},
journal= {arXiv preprint arXiv:2010.02322},
year = {2020}
}
备注
EMNLP 2020 Long Paper