中文

利用QA数据集改进生成式数据增强

计算与语言 2022-10-26 v2

摘要

生成式语言模型(GLM)生成文本的能力在过去几年中显著提升,使其可用于生成式数据增强。在这项工作中,我们提出CONDA,一种通过将数据生成重新表述为给定问答(QA)对的上下文生成、并利用QA数据集训练上下文生成器来进一步提升GLM生成合成数据能力的方法。然后,我们将下游任务转换为相同的问答格式,并使微调后的上下文生成器适应目标任务领域。最后,我们使用微调后的GLM生成相关上下文,这些上下文进而用作相应任务的合成训练数据。我们在多个分类数据集上进行了大量实验,并在少样本和零样本设置下均展示了性能的显著提升。我们的分析表明,需要高水平推理能力的QA数据集(例如抽象式和常识QA数据集)往往在少样本和零样本设置下带来最佳的性能提升。

关键词

引用

@article{arxiv.2205.12604,
  title  = {Leveraging QA Datasets to Improve Generative Data Augmentation},
  author = {Dheeraj Mekala and Tu Vu and Timo Schick and Jingbo Shang},
  journal= {arXiv preprint arXiv:2205.12604},
  year   = {2022}
}