面向序列到序列模型的变分注意力机制
计算与语言
2018-06-25 v3
摘要
变分编码器-解码器(VED)使用神经网络将源信息编码为一组随机变量,进而通过另一神经网络解码为目标数据。在自然语言处理中,序列到序列(Seq2Seq)模型通常充当编码器-解码器网络。当与传统(确定性)注意力机制结合时,变分潜空间可能被注意力模型绕过,从而变得无效。在本文中,我们提出一种用于 VED 的变分注意力机制,其中注意力向量也被建模为高斯分布的随机变量。两项实验的结果表明,在不损失质量的前提下,我们所提方法缓解了绕过现象,因为它增加了生成句子的多样性。
引用
@article{arxiv.1712.08207,
title = {Variational Attention for Sequence-to-Sequence Models},
author = {Hareesh Bahuleyan and Lili Mou and Olga Vechtomova and Pascal Poupart},
journal= {arXiv preprint arXiv:1712.08207},
year = {2018}
}
备注
In Proceedings of COLING 2018. Also accepted by TADGM Workshop@ICML 2018 for presentation