学习词嵌入的维度
机器学习
2017-04-14 v3 计算与语言
机器学习
摘要
我们描述了一种学习具有数据依赖维度的词嵌入的方法。我们的随机维度Skip-Gram (SD-SG)和随机维度连续词袋(SD-CBOW)是Mikolov等人(2013)著名“word2vec”模型的非参数类比。通过采用Cote & Larochelle (2016)用于定义具有无限隐藏单元数的RBM的技术,使向量维度动态化。我们从定性和定量上表明SD-SG和SD-CBOW与其固定维度对应模型具有竞争力,同时提供嵌入维度的分布,这为语义如何跨维度分布提供了一扇窗口。
引用
@article{arxiv.1511.05392,
title = {Learning the Dimensionality of Word Embeddings},
author = {Eric Nalisnick and Sachin Ravi},
journal= {arXiv preprint arXiv:1511.05392},
year = {2017}
}