中文

用深度概率层正则化 Transformer

计算与语言 2021-08-25 v1 机器学习

摘要

在过去十年中,语言模型(LM)从无休止地增长,从序列到序列架构发展到最先进的、纯粹的基于注意力的 Transformer。在本工作中,我们展示了在 BERT 中引入深度生成模型如何带来更具通用性的模型,能够用更丰富的文本填补缺失/含噪词,甚至提升 BLEU 分数。更确切地说,我们使用高斯混合变分自编码器(GMVAE)作为正则化层,并证明其有效性不仅体现在 Transformer 中,也体现在最相关的基于编码器-解码器的 LM,即带注意力与不带注意力的 seq2seq 中。

关键词

引用

@article{arxiv.2108.10764,
  title  = {Regularizing Transformers With Deep Probabilistic Layers},
  author = {Aurora Cobo Aguilera and Pablo Martínez Olmos and Antonio Artés-Rodríguez and Fernando Pérez-Cruz},
  journal= {arXiv preprint arXiv:2108.10764},
  year   = {2021}
}