中文

SegMix:一种简单的结构感知数据增强方法

计算与语言 2023-11-17 v1 人工智能 机器学习

摘要

基于插值的数据增强(Data Augmentation, DA)方法(Mixup)对两个或多个训练样本的输人与标签进行线性插值。Mixup近来已被引入自然语言处理(Natural Language Processing, NLP)领域,主要用于序列标注任务。然而,这种简单套用相较于基线模型带来了不稳定或混合的改进。我们认为直接套用的方法未考虑NLP任务中的结构。为此,我们提出SegMix,一组可适应任务特定结构的基于插值的DA算法。SegMix对数据结构施加更少约束,对各类超参数设置具有鲁棒性,适用于更多任务设定,且几乎不增加计算开销。该算法的核心在于,我们将插值方法应用于任务特定的有意义片段,而非如先前工作那样应用于序列。我们发现SegMix是一个灵活的框架,将基于规则的DA方法与基于插值的方法相结合,创造出有趣的DA技术混合。我们表明,在命名实体识别(Named Entity Recognition, NER)和关系抽取(Relation Extraction, RE)任务中,尤其在数据稀缺设定下,SegMix相较强基线模型持续带来性能提升。此外,该方法易于实现且训练开销可忽略不计。

关键词

引用

@article{arxiv.2311.09505,
  title  = {SegMix: A Simple Structure-Aware Data Augmentation Method},
  author = {Yuxin Pei and Pushkar Bhuse and Zhengzhong Liu and Eric Xing},
  journal= {arXiv preprint arXiv:2311.09505},
  year   = {2023}
}

备注

Upload of a work done in 2022