更深地融合它!一种用于文本生成的具有逐层潜变量推断的变分 Transformer
计算与语言
2022-10-24 v2
摘要
过去几年中,变分自编码器(VAE)在各种文本生成任务中展现出优越性。然而,由于文本的序列特性,自回归解码器往往忽略潜变量而退化为简单的语言模型,即所谓的 KL 消失问题,当 VAE 与基于 Transformer 的结构结合时该问题会进一步恶化。为缓解此问题,我们提出 DELLA,一种新颖的变分 Transformer 框架。DELLA 学习一系列逐层潜变量,每个变量由较低层变量推断得到,并通过低秩张量积与隐藏状态紧密耦合。以此方式,DELLA 迫使这些后验潜变量与整个计算路径深度融合,从而纳入更多信息。我们从理论上证明,我们的方法可视为纠缠潜变量以避免后验信息随层递减,使 DELLA 即使无任何退火或阈值技巧也能获得更高的非零 KL 值。在四个无条件与三个条件生成任务上的实验表明,与若干强基线相比,DELLA 能更好地缓解 KL 消失并提升质量与多样性。
引用
@article{arxiv.2207.06130,
title = {Fuse It More Deeply! A Variational Transformer with Layer-Wise Latent Variable Inference for Text Generation},
author = {Jinyi Hu and Xiaoyuan Yi and Wenhao Li and Maosong Sun and Xing Xie},
journal= {arXiv preprint arXiv:2207.06130},
year = {2022}
}
备注
NAACL 2022