中文

基于 Sparsemax 与松弛 Wasserstein 的主题稀疏性方法

机器学习 2018-11-29 v2 信息检索 机器学习

摘要

主题稀疏性是指这样一种现象:单个文档通常聚焦于若干显著主题,而非覆盖广泛主题;且一个真实主题采用较窄的术语范围,而非广泛覆盖词汇表。理解这种主题稀疏性对于分析用户生成的网络内容和社交媒体尤为重要,这些内容以极短的帖子和讨论为特征。随着在线社交媒体中单个文档的主题稀疏性增加,使用传统方法分析在线文本源的困难也随之增加。在本文中,我们提出两种新颖的神经模型,通过基于高斯 sparsemax 构造提供主题上的稀疏后验分布,从而实现通过随机反向传播的高效训练。我们构建了一个以输入数据为条件的推断网络,并利用松弛 Wasserstein(RW)散度推断变分分布。与基于高斯 softmax 构造和 Kullback-Leibler(KL)散度的现有工作不同,我们的方法能够以训练稳定性、预测性能和主题一致性识别潜在主题稀疏性。在不同体裁的大型文本语料库上的实验证明了我们模型的有效性,因为它们优于概率方法和神经方法。

关键词

引用

@article{arxiv.1810.09079,
  title  = {Sparsemax and Relaxed Wasserstein for Topic Sparsity},
  author = {Tianyi Lin and Zhiyue Hu and Xin Guo},
  journal= {arXiv preprint arXiv:1810.09079},
  year   = {2018}
}

备注

10 Pages. To appear in WSDM 2019