中文

基于残差能量模型的文本生成

计算与语言 2020-04-27 v1 机器学习

摘要

文本生成在许多 NLP 任务中无处不在,从摘要、对话到机器翻译。主导的参数化方法基于局部归一化模型,一次预测一个词。尽管这些方法表现极为出色,但由于生成过程的贪婪本性,它们受到暴露偏差的困扰。在这项工作中,我们研究在序列层面而非词元层面运作的未归一化能量基模型(EBM)。为使训练易于处理,我们首先在预训练的局部归一化语言模型的残差中工作,其次我们使用噪声对比估计进行训练。此外,由于 EBM 在序列层面工作,我们可以利用预训练的双向上下文表示,如 BERT 和 RoBERTa。我们在两个大型语言建模数据集上的实验表明,残差 EBM 相比局部归一化基线具有更低的困惑度。而且,通过重要性采样进行生成非常高效,并且根据人工评估,其质量高于基线模型。

关键词

引用

@article{arxiv.2004.11714,
  title  = {Residual Energy-Based Models for Text Generation},
  author = {Yuntian Deng and Anton Bakhtin and Myle Ott and Arthur Szlam and Marc'Aurelio Ranzato},
  journal= {arXiv preprint arXiv:2004.11714},
  year   = {2020}
}

备注

published at ICLR 2020. arXiv admin note: substantial text overlap with arXiv:2004.10188