中文

基于扩散语言模型的文本生成:一种连续段落去噪的预训练方法

计算与语言 2023-02-20 v2 机器学习

摘要

本文提出一种用于文本生成的新型扩散语言模型预训练框架,称为 GENIE。GENIE 是一个大规模预训练扩散语言模型,由编码器与基于扩散的解码器组成,可通过将随机噪声序列逐步转化为连贯文本序列来生成文本。为在大规模语料上预训练 GENIE,我们设计了一种新的连续段落去噪目标,鼓励扩散解码器从受损版本重建干净文本段落,同时保持语义与句法连贯性。我们在四个下游文本生成基准(即 XSum、CNN/DailyMail、Gigaword 与 CommonGen)上评估 GENIE。实验结果表明,GENIE 在这些基准上取得了与最先进自回归模型相当的性能,并生成更多样化的文本样本。GENIE 的代码与模型可在 https://github.com/microsoft/ProphetNet/tree/master/GENIE 获取。

关键词

引用

@article{arxiv.2212.11685,
  title  = {Text Generation with Diffusion Language Models: A Pre-training Approach with Continuous Paragraph Denoise},
  author = {Zhenghao Lin and Yeyun Gong and Yelong Shen and Tong Wu and Zhihao Fan and Chen Lin and Nan Duan and Weizhu Chen},
  journal= {arXiv preprint arXiv:2212.11685},
  year   = {2023}
}

备注

Previous version title -> GENIE: Large Scale Pre-training for Text Generation with Diffusion Model