使用变分自编码器的连续语义主题嵌入模型
机器学习
2017-11-27 v1 计算与语言
机器学习
摘要
本文提出连续语义主题嵌入模型(CSTEM),该模型利用变分自编码器(VAE),通过主题与词之间连续语义距离函数寻找文档中的潜在主题变量。语义距离可由欧氏空间上任意对称的钟形几何距离函数表示,本文中采用马氏距离。为使语义距离表现更恰当,我们新引入每个词的附加模型参数,以从该距离中提取指示其不论主题如何发生可能性的全局因子。这确实改善了先前连续词嵌入主题模型中使用的高斯分布不能正确解释语义关系的问题,并有助于获得更高的主题一致性。通过在 20 Newsgroup、NIPS 论文和 CNN/Dailymail 语料库上的实验,我们的模型达到了近期最先进模型的性能,并生成主题嵌入向量,使得观察主题向量在真实欧氏空间中与词向量的嵌入位置以及主题间语义关联成为可能。
引用
@article{arxiv.1711.08870,
title = {Continuous Semantic Topic Embedding Model Using Variational Autoencoder},
author = {Namkyu Jung and Hyeong In Choi},
journal= {arXiv preprint arXiv:1711.08870},
year = {2017}
}