中文

更深地融合它!一种用于文本生成的具有逐层潜变量推断的变分 Transformer

计算与语言 2022-10-24 v2

摘要

过去几年中,变分自编码器(VAE)在各种文本生成任务中展现出优越性。然而,由于文本的序列特性,自回归解码器往往忽略潜变量而退化为简单的语言模型,即所谓的 KL 消失问题,当 VAE 与基于 Transformer 的结构结合时该问题会进一步恶化。为缓解此问题,我们提出 DELLA,一种新颖的变分 Transformer 框架。DELLA 学习一系列逐层潜变量,每个变量由较低层变量推断得到,并通过低秩张量积与隐藏状态紧密耦合。以此方式,DELLA 迫使这些后验潜变量与整个计算路径深度融合,从而纳入更多信息。我们从理论上证明,我们的方法可视为纠缠潜变量以避免后验信息随层递减,使 DELLA 即使无任何退火或阈值技巧也能获得更高的非零 KL 值。在四个无条件与三个条件生成任务上的实验表明,与若干强基线相比,DELLA 能更好地缓解 KL 消失并提升质量与多样性。

关键词

引用

@article{arxiv.2207.06130,
  title  = {Fuse It More Deeply! A Variational Transformer with Layer-Wise Latent Variable Inference for Text Generation},
  author = {Jinyi Hu and Xiaoyuan Yi and Wenhao Li and Maosong Sun and Xing Xie},
  journal= {arXiv preprint arXiv:2207.06130},
  year   = {2022}
}

备注

NAACL 2022