中文

Optimus:通过潜空间预训练建模组织句子

计算与语言 2020-10-13 v4 机器学习 机器学习

摘要

当被有效训练时,变分自编码器(VAE)既可成为强大的生成模型,也可成为自然语言的有效表示学习框架。本文中,我们提出首个大规模语言VAE模型Optimus。首先在大文本语料上预训练一个用于句子的通用潜嵌入空间,然后针对各种语言生成与理解任务进行微调。与GPT-2相比,Optimus能够利用潜向量从抽象层面引导语言生成。与BERT相比,由于平滑的潜空间结构,Optimus在低资源语言理解任务上能更好地泛化。在广泛语言任务上的大量实验结果证明了Optimus的有效性。它在VAE语言建模基准上取得了新的state-of-the-art。我们希望我们这第一个预训练的大型VAE语言模型本身及结果能帮助NLP社区在大规模预训练时代重燃对深度生成模型的兴趣,并使这些基于原理的方法更实用。

关键词

引用

@article{arxiv.2004.04092,
  title  = {Optimus: Organizing Sentences via Pre-trained Modeling of a Latent Space},
  author = {Chunyuan Li and Xiang Gao and Yuan Li and Baolin Peng and Xiujun Li and Yizhe Zhang and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2004.04092},
  year   = {2020}
}

备注

Accepted in EMNLP 2020; Code: https://github.com/ChunyuanLI/Optimus Demo: http://aka.ms/optimus