用深度概率层正则化 Transformer
计算与语言
2021-08-25 v1 机器学习
摘要
在过去十年中,语言模型(LM)从无休止地增长,从序列到序列架构发展到最先进的、纯粹的基于注意力的 Transformer。在本工作中,我们展示了在 BERT 中引入深度生成模型如何带来更具通用性的模型,能够用更丰富的文本填补缺失/含噪词,甚至提升 BLEU 分数。更确切地说,我们使用高斯混合变分自编码器(GMVAE)作为正则化层,并证明其有效性不仅体现在 Transformer 中,也体现在最相关的基于编码器-解码器的 LM,即带注意力与不带注意力的 seq2seq 中。
引用
@article{arxiv.2108.10764,
title = {Regularizing Transformers With Deep Probabilistic Layers},
author = {Aurora Cobo Aguilera and Pablo Martínez Olmos and Antonio Artés-Rodríguez and Fernando Pérez-Cruz},
journal= {arXiv preprint arXiv:2108.10764},
year = {2021}
}