基于修正的跳字负采样模型再探
计算与语言
2019-01-15 v2 机器学习
机器学习
摘要
我们重新审视跳字负采样(SGNS)——最流行的基于神经网络学习分布式词表示的模型之一。我们首先指出削弱 SGNS 模型的歧义问题,即在不改变目标函数值的情况下词向量可被完全扭曲。为解决该问题,我们研究了良好词嵌入模型应给出的解的内在结构。受此启发,我们用二次正则化修正 SGNS 模型,并表明这一简单修正足以按期望方式结构化解。我们给出了理论依据,为二次正则化提供了新颖见解。我们还在 Google 类比推理任务上进行了初步实验以支持修正后的 SGNS 模型。
引用
@article{arxiv.1804.00306,
title = {Revisiting Skip-Gram Negative Sampling Model with Rectification},
author = {Cun Mu and Guang Yang and Zheng Yan},
journal= {arXiv preprint arXiv:1804.00306},
year = {2019}
}
备注
Accepted for publication in the proceedings of 2019 Computing Conference