中文

word2vec参数学习详解

计算与语言 2016-06-07 v4

摘要

Mikolov等人的word2vec模型及应用在近两年引起了广泛关注。word2vec模型学习到的词向量表示已被证明携带语义信息,并在各种自然语言处理任务中非常有用。随着越来越多的研究人员希望尝试word2vec或类似技术,我注意到缺乏一份全面详细解释词嵌入模型参数学习过程的资料,从而阻碍了非神经网络专家的研究人员理解此类模型的工作机制。本文提供了word2vec模型参数更新方程的详细推导和解释,包括原始的连续词袋(CBOW)和跳字(SG)模型,以及先进的优化技术,包括层次softmax和负采样。梯度方程的直观解释也随数学推导一起提供。在附录中,回顾了神经网络和反向传播的基础知识。我还创建了一个交互式演示wevi,以促进对模型的直观理解。

关键词

引用

@article{arxiv.1411.2738,
  title  = {word2vec Parameter Learning Explained},
  author = {Xin Rong},
  journal= {arXiv preprint arXiv:1411.2738},
  year   = {2016}
}