中文

GENIUS:基于草图的极端选择性掩码语言模型预训练用于文本生成与增强

计算与语言 2022-11-21 v1

摘要

我们提出 GENIUS:一种以草图作为输入的Conditional文本生成模型,可为给定草图(由掩码 token 连接的文本跨度、短语或单词组成的关键信息)填补缺失上下文。GENIUS 在大规模文本语料库上通过一种使用极端选择性掩码策略的草图重构目标进行预训练,使其能够基于草图生成多样且高质量的文本。与其他有竞争力的条件语言模型(CLM)的比较揭示了 GENIUS 文本生成质量的优越性。我们进一步展示 GENIUS 可用作各类自然语言处理(NLP)任务的强大且即插即用的数据增强工具。大多数现有文本数据增强方法要么过于保守(对原文做微小改动),要么过于激进(完全创建新样本)。借助 GENIUS,我们提出 GeniusAug,它首先从原始训练集中提取目标感知草图,然后基于草图生成新样本。在 6 个文本分类数据集上的实证实验表明,GeniusAug 在分布内(ID)和分布外(OOD)设定下均显著提升了模型性能。我们还展示了 GeniusAug 在命名实体识别(NER)和机器阅读理解(MRC)任务上的有效性。(代码与模型公开于 https://github.com/microsoft/SCGLab 和 https://github.com/beyondguo/genius)

关键词

引用

@article{arxiv.2211.10330,
  title  = {GENIUS: Sketch-based Language Model Pre-training via Extreme and Selective Masking for Text Generation and Augmentation},
  author = {Biyang Guo and Yeyun Gong and Yelong Shen and Songqiao Han and Hailiang Huang and Nan Duan and Weizhu Chen},
  journal= {arXiv preprint arXiv:2211.10330},
  year   = {2022}
}

备注

21 pages