中文

用于文本建模的离散自回归变分注意力模型

机器学习 2021-06-17 v1 计算与语言

摘要

变分自编码器(VAEs)已被广泛应用于文本建模。然而在实践中,它们受到两个挑战的困扰:信息表示不足和后验坍缩。前者源于仅将 LSTM 编码器的最后隐藏状态变换到潜空间,这通常不足以概括数据。后者是 VAE 训练过程中长期存在的问题,因为优化陷入了灾难性的局部最优。在本文中,我们提出离散自回归变分注意力模型(Discrete Auto-regressive Variational Attention Model, DAVAM)来解决这些挑战。具体而言,我们引入一种自回归变分注意力方法,通过有效捕获输入的语义依赖来丰富潜空间。我们进一步为变分注意力设计离散潜空间,并从数学上证明我们的模型不存在后验坍缩。在语言建模任务上的大量实验证明了 DAVAM 相对于若干 VAE 对应模型的优越性。

关键词

引用

@article{arxiv.2106.08571,
  title  = {Discrete Auto-regressive Variational Attention Models for Text Modeling},
  author = {Xianghong Fang and Haoli Bai and Jian Li and Zenglin Xu and Michael Lyu and Irwin King},
  journal= {arXiv preprint arXiv:2106.08571},
  year   = {2021}
}

备注

IJCNN 2021