学习带有不确定性的文档嵌入
计算与语言
2020-08-03 v3 机器学习
摘要
大多数文本建模技术仅产生文档嵌入的点估计,且未能捕捉估计的不确定性。这些不确定性给出了嵌入在多大程度上代表一篇文档的概念。我们提出贝叶斯子空间多项模型(Bayesian SMM),一种生成式对数线性模型,其学习以高斯分布形式表示文档,从而将不确定性编码于其协方差中。此外,在所提出的贝叶斯 SMM 中,我们解决了混合 logit 模型变分推断中出现的不可处理这一常见问题。我们还提出一种利用文档嵌入中不确定性的生成式高斯线性分类器用于主题识别。我们使用困惑度度量的内在评估表明,在 Fisher 语音和 20Newsgroups 文本语料库上,所提出的贝叶斯 SMM 比最先进的神经变分文档模型更好地拟合数据。我们的主题识别实验表明,所提出的系统对未见测试数据上的过拟合具有鲁棒性。主题 ID 结果显示,所提出的模型优于最先进的无监督主题模型,并取得了与最先进的完全监督判别模型相当的结果。
引用
@article{arxiv.1908.07599,
title = {Learning document embeddings along with their uncertainties},
author = {Santosh Kesiraju and Oldřich Plchot and Lukáš Burget and Suryakanth V Gangashetty},
journal= {arXiv preprint arXiv:1908.07599},
year = {2020}
}