用于文本建模的离散自回归变分注意力模型
机器学习
2021-06-17 v1 计算与语言
摘要
变分自编码器(VAEs)已被广泛应用于文本建模。然而在实践中,它们受到两个挑战的困扰:信息表示不足和后验坍缩。前者源于仅将 LSTM 编码器的最后隐藏状态变换到潜空间,这通常不足以概括数据。后者是 VAE 训练过程中长期存在的问题,因为优化陷入了灾难性的局部最优。在本文中,我们提出离散自回归变分注意力模型(Discrete Auto-regressive Variational Attention Model, DAVAM)来解决这些挑战。具体而言,我们引入一种自回归变分注意力方法,通过有效捕获输入的语义依赖来丰富潜空间。我们进一步为变分注意力设计离散潜空间,并从数学上证明我们的模型不存在后验坍缩。在语言建模任务上的大量实验证明了 DAVAM 相对于若干 VAE 对应模型的优越性。
引用
@article{arxiv.2106.08571,
title = {Discrete Auto-regressive Variational Attention Models for Text Modeling},
author = {Xianghong Fang and Haoli Bai and Jian Li and Zenglin Xu and Michael Lyu and Irwin King},
journal= {arXiv preprint arXiv:2106.08571},
year = {2021}
}
备注
IJCNN 2021