面向大词表的高网络效率分布式 Word2vec 训练系统
计算与语言
2016-06-29 v1
摘要
Word2vec 是一类流行的算法,用于在大型文本语料库上无监督地训练词的稠密向量表示。所得向量已被证明能够捕捉对应词之间的语义关系,并有望将许多自然语言处理(NLP)任务化简为对这些向量的数学运算。尽管迄今为止 word2vec 的应用集中于包含数百万词的词表(词表指同时训练其向量的词集合),但在 NLP 之外的领域正涌现出具有数亿词词表的新应用。现有的 word2vec 训练系统对于训练如此大词表不切实际,因为它们要么要求将所有词表词的向量存储在单台服务器的内存中,要么因海量网络数据传输而承受无法接受的训练延迟。本文提出一种新颖的分布式并行训练系统,能够在商用服务器共享集群上以前所未有的实用性训练数亿词词表的向量,且使用的网络流量远少于现有方案。我们在基准数据集上评估了所提系统,表明向量质量相对于非分布式训练并未下降。最后,该系统已在雅虎赞助搜索广告平台 Gemini 中部署数个季度,用于查询与广告的匹配,使业务指标得到显著改善。
引用
@article{arxiv.1606.08495,
title = {Network-Efficient Distributed Word2vec Training System for Large Vocabularies},
author = {Erik Ordentlich and Lee Yang and Andy Feng and Peter Cnudde and Mihajlo Grbovic and Nemanja Djuric and Vladan Radosavljevic and Gavin Owens},
journal= {arXiv preprint arXiv:1606.08495},
year = {2016}
}
备注
10 pages, 2 figures