中文

用主题嵌入混合表示词嵌入混合

机器学习 2022-03-16 v2 统计方法学 机器学习

摘要

主题模型常被表述为一种生成模型,解释在给定一组主题和文档特定主题比例下文档中每个词如何生成。它侧重于捕捉文档中的词共现,因此常在分析短文档时表现不佳。此外,其参数估计常依赖近似后验推断,要么不可扩展,要么存在较大近似误差。本文引入一种新的主题建模框架,其中每篇文档被视为一组词嵌入向量,每个主题被建模为同一嵌入空间中的一个嵌入向量。将词与主题嵌入于同一向量空间,我们定义了一种方法来度量文档词嵌入向量与主题嵌入向量之间的语义差异,并优化主题嵌入以最小化所有文档上的期望差异。文本分析实验表明,所提方法适用于基于 mini-batch 随机梯度下降的优化,因而可扩展至大型语料库,在发现更具连贯性与多样性的主题以及提取更优文档表示方面提供了有竞争力的性能。

关键词

引用

@article{arxiv.2203.01570,
  title  = {Representing Mixtures of Word Embeddings with Mixtures of Topic Embeddings},
  author = {Dongsheng Wang and Dandan Guo and He Zhao and Huangjie Zheng and Korawat Tanwisuth and Bo Chen and Mingyuan Zhou},
  journal= {arXiv preprint arXiv:2203.01570},
  year   = {2022}
}

备注

Proceedings of ICLR, 2022