中文

联合学习词嵌入与潜在主题

计算与语言 2017-06-23 v1 信息检索 机器学习

摘要

诸如 Skip-gram 之类的词嵌入模型基于在文本语料库中观察到的局部词语搭配模式,为每个词学习一个向量空间表示。另一方面,潜在主题模型采取更全局的视角,通过观察整个语料库中的词分布来为每次词出现分配一个主题。这两种范式在表示词出现的含义方面是互补的。尽管先前的一些工作已经探讨了利用词嵌入来提升潜在主题的质量,反之亦然,利用潜在主题来改进词嵌入,但此类“两步走”方法无法捕捉两种范式之间的相互作用。在本文中,我们提出了 STE 框架,能够以统一的方式学习词嵌入和潜在主题。STE 自然地获得了特定主题的词嵌入,从而解决了多义性问题。同时,它还学习了主题的词项分布和文档的主题分布。实验结果表明,STE 模型确实能够以有效且高效的方式生成有用的特定主题词嵌入和连贯的潜在主题。

关键词

引用

@article{arxiv.1706.07276,
  title  = {Jointly Learning Word Embeddings and Latent Topics},
  author = {Bei Shi and Wai Lam and Shoaib Jameel and Steven Schockaert and Kwun Ping Lai},
  journal= {arXiv preprint arXiv:1706.07276},
  year   = {2017}
}

备注

10 pagess, 2 figures, full paper. To appear in the proceedings of The 40th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '17)