改进词表示:用于负采样的子采样一元分布
计算与语言
2019-10-22 v1
摘要
Word2Vec是最流行的词表示模型,已在文献中被广泛研究。然而,其用于负采样的噪声分布由经验试验决定,最优性一直被忽视。我们指出该分布是次优选择,并提议使用子采样一元分布以实现更好的负采样。我们的贡献包括:(1)提出语义量化的概念,并推导出所提分布适应不同训练语料的合适子采样率;(2)通过大量评测任务展示我们的方法在负采样和噪声对比估计两方面的优势;以及(3)针对MSR句子补全任务提出语义加权模型,带来显著改进。我们的工作不仅提升了词向量的质量,也裨益于当前对Word2Vec的理解。
引用
@article{arxiv.1910.09362,
title = {Improving Word Representations: A Sub-sampled Unigram Distribution for Negative Sampling},
author = {Wenxiang Jiao and Irwin King and Michael R. Lyu},
journal= {arXiv preprint arXiv:1910.09362},
year = {2019}
}
备注
10 pages