中文

KnowDA:面向低资源NLP数据增强的全能知识混合模型

计算与语言 2023-01-30 v2

摘要

本文关注训练集有限的低资源NLP任务的数据增强。现有方案要么利用与任务无关的启发式规则(如 synonym replacement),要么利用有限的训练样本微调通用预训练语言模型(如 GPT2)以生成新的合成数据。因此,它们缺乏任务特定知识,且只能产生低质量的合成数据。为应对该问题,我们提出知识混合数据增强模型(KnowDA),这是一个在知识混合训练(KoMT)新框架下于多种异构NLP任务混合数据上预训练的 Seq2Seq 语言模型。KoMT 的目标是将多样的NLP任务特定知识压缩进单一的 KnowDA 模型(即 all-in-one),从而使 KnowDA 能够利用这些知识通过有限的训练样本快速掌握目标任务的内在合成规律。具体而言,KoMT 将来自不同异构NLP任务的输入样例重构为统一的 text-to-text 格式,并采用不同粒度的去噪训练目标来学习重构部分或完整样本。据我们所知,我们是首个将 100+ NLP 多任务训练应用于数据增强的尝试。大量实验表明:i) KnowDA 生成的合成数据在低资源NLP基准 FewGLUE、CoNLL'03 和 WikiAnn 上大幅提升了强预训练语言模型(即 Bert、ALBert 和 Deberta)的性能;ii) KnowDA 成功地将任务知识迁移到 KoMT 中已见和未见类型的NLP任务上。

关键词

引用

@article{arxiv.2206.10265,
  title  = {KnowDA: All-in-One Knowledge Mixture Model for Data Augmentation in Low-Resource NLP},
  author = {Yufei Wang and Jiayi Zheng and Can Xu and Xiubo Geng and Tao Shen and Chongyang Tao and Daxin Jiang},
  journal= {arXiv preprint arXiv:2206.10265},
  year   = {2023}
}

备注

Accepted by ICLR 2023 main track at https://openreview.net/forum?id=2nocgE1m0A