中文

对抗性词语稀释作为低资源场景下的文本数据增强

计算与语言 2023-08-10 v2

摘要

数据增强在文本分类中被广泛使用,尤其是在低资源场景下,训练时每个类别仅有少量样本可用。尽管取得了成功,但生成可能提升有效性的困难正例作为数据增强仍鲜有探索。本文提出一种对抗性词语稀释(AWD)方法,可生成困难正例作为文本数据增强,以高效训练低资源文本分类模型。我们增强文本数据的思路是通过与未知词嵌入加权混合来稀释强正词的嵌入,使增强后的输入难以被分类模型识别为正例。我们通过带标签引导的约束极小-极大优化过程对抗地学习稀释权重。在三个基准数据集上的实证研究表明,AWD 能生成更有效的数据增强,并优于 SOTA 文本数据增强方法。附加分析表明,AWD 生成的数据增强具有可解释性,且可灵活扩展到新样本而无需进一步训练。

关键词

引用

@article{arxiv.2305.09287,
  title  = {Adversarial Word Dilution as Text Data Augmentation in Low-Resource Regime},
  author = {Junfan Chen and Richong Zhang and Zheyan Luo and Chunming Hu and Yongyi Mao},
  journal= {arXiv preprint arXiv:2305.09287},
  year   = {2023}
}

备注

Preprint, Accepted by AAAI 2023