word2vec参数学习详解
计算与语言
2016-06-07 v4
摘要
Mikolov等人的word2vec模型及应用在近两年引起了广泛关注。word2vec模型学习到的词向量表示已被证明携带语义信息,并在各种自然语言处理任务中非常有用。随着越来越多的研究人员希望尝试word2vec或类似技术,我注意到缺乏一份全面详细解释词嵌入模型参数学习过程的资料,从而阻碍了非神经网络专家的研究人员理解此类模型的工作机制。本文提供了word2vec模型参数更新方程的详细推导和解释,包括原始的连续词袋(CBOW)和跳字(SG)模型,以及先进的优化技术,包括层次softmax和负采样。梯度方程的直观解释也随数学推导一起提供。在附录中,回顾了神经网络和反向传播的基础知识。我还创建了一个交互式演示wevi,以促进对模型的直观理解。
引用
@article{arxiv.1411.2738,
title = {word2vec Parameter Learning Explained},
author = {Xin Rong},
journal= {arXiv preprint arXiv:1411.2738},
year = {2016}
}