中文

基于序列归一化最大似然的Word2vec Skip-gram维数选择

机器学习 2020-08-26 v3 计算与语言 机器学习

摘要

本文提出一种基于信息准则的新方法来选择word2vec Skip-gram(SG)的维数。从概率论视角看,SG被视为在词之间存在真实上下文分布的假设下的一种隐式概率分布估计。因此,我们应用信息准则以选择最佳维数,使相应模型尽可能接近真实分布。我们考察了以下用于维数选择问题的信息准则:赤池信息准则(AIC)、贝叶斯信息准则(BIC)和序列归一化最大似然(SNML)准则。SNML是基于最小描述长度对数据序列进行顺序编码所需的总码长。所提方法应用于原始SG模型和SG负采样模型,以阐明使用信息准则的思想。此外,由于原始SNML存在计算上的缺陷,我们引入了新的启发式方法以实现高效计算。而且,我们通过实证表明SNML优于BIC和AIC。与其他词嵌入评价方法相比,由SNML选择的维数显著更接近通过词类比或词语相似度任务获得的最优维数。

关键词

引用

@article{arxiv.2008.07720,
  title  = {Word2vec Skip-gram Dimensionality Selection via Sequential Normalized Maximum Likelihood},
  author = {Pham Thuc Hung and Kenji Yamanishi},
  journal= {arXiv preprint arXiv:2008.07720},
  year   = {2020}
}