中文

面向低资源分类的多样性增强与约束松弛增强方法

计算与语言 2021-09-27 v1

摘要

数据增强(DA)旨在生成受约束且多样化的数据,以改进低资源分类(LRC)中的分类器。以往研究大多使用微调后的语言模型(LM)来加强约束,却忽视了多样性潜力可提升生成数据有效性的事实。在LRC中,DA的强约束但弱多样性导致分类器泛化能力不佳。为解决这一困境,我们提出一种多样性增强与约束松弛增强方法(DECRA)。我们的DECRA在以transformer为骨干模型的基础上包含两个核心组件。1) 作为DECRA核心组件的k-beta增强,用于提升受约束数据生成中的多样性。它扩大了变更范围并提高了生成数据的复杂程度。2) 使用掩码语言模型损失而非微调作为正则化。它松弛了约束,使分类器能用更分散的生成数据进行训练。这两个组件的结合生成的数据能够到达或接近类别边界,从而帮助分类器更好地泛化。我们在低资源设置下的三个公开基准数据集上评估了DECRA。大量实验表明,DECRA在总体得分上以3.8%的优势超越最先进的方法。

关键词

引用

@article{arxiv.2109.11834,
  title  = {A Diversity-Enhanced and Constraints-Relaxed Augmentation for Low-Resource Classification},
  author = {Guang Liu and Hailong Huang and Yuzhao Mao and Weiguo Gao and Xuan Li and Jianping Shen},
  journal= {arXiv preprint arXiv:2109.11834},
  year   = {2021}
}