中文

学习词嵌入的维度

机器学习 2017-04-14 v3 计算与语言 机器学习

摘要

我们描述了一种学习具有数据依赖维度的词嵌入的方法。我们的随机维度Skip-Gram (SD-SG)和随机维度连续词袋(SD-CBOW)是Mikolov等人(2013)著名“word2vec”模型的非参数类比。通过采用Cote & Larochelle (2016)用于定义具有无限隐藏单元数的RBM的技术,使向量维度动态化。我们从定性和定量上表明SD-SG和SD-CBOW与其固定维度对应模型具有竞争力,同时提供嵌入维度的分布,这为语义如何跨维度分布提供了一扇窗口。

关键词

引用

@article{arxiv.1511.05392,
  title  = {Learning the Dimensionality of Word Embeddings},
  author = {Eric Nalisnick and Sachin Ravi},
  journal= {arXiv preprint arXiv:1511.05392},
  year   = {2017}
}