中文

FULL-W2V:在GPU加速系统上充分挖掘W2V的数据复用

机器学习 2023-12-14 v1 计算与语言 分布式、并行与集群计算

摘要

Word2Vec依然是自然语言处理(NLP)领域极具影响力的创新之一,它以低维稠密向量表示人类文本中潜在的语法和句法信息。由于算法固有的顺序性、密集的内存访问以及所表示的大规模词汇表,Word2Vec具有很高的计算成本。尽管已有研究探索了利用并行性和改善内存系统性能的技术,但它们难以在强大的GPU上有效提升吞吐量。我们确定内存数据访问和延迟是先前GPU工作的主要瓶颈,这阻碍了高度优化的内核达到架构的峰值性能。我们提出了一种新颖的算法FULL-W2V,它最大限度地利用了W2V算法中的数据复用机会,并利用GPU架构和资源来减少对低层内存的访问并改善时间局部性。与先前最先进的GPU实现相比,FULL-W2V能够显著减少对GPU全局内存的访问,例如减少超过89%,从而带来显著的性能提升,并可跨代硬件扩展。我们的原型实现在从Nvidia Pascal P100移植到Volta V100显卡时实现了2.97倍的加速,并在V100显卡上以相同的嵌入质量超越现有最佳方案5.72倍。深入分析表明,通过寄存器和共享内存缓存以及高吞吐量共享内存归约来减少内存访问,显著提高了算术强度。FULL-W2V有望惠及NLP及其他领域的诸多应用。

关键词

引用

@article{arxiv.2312.07743,
  title  = {FULL-W2V: Fully Exploiting Data Reuse for W2V on GPU-Accelerated Systems},
  author = {Thomas Randall and Tyler Allen and Rong Ge},
  journal= {arXiv preprint arXiv:2312.07743},
  year   = {2023}
}

备注

12 pages, 7 figures, 7 tables, the definitive version of this work is published in the Proceedings of the ACM International Conference on Supercomputing 2021, available at https://doi.org/10.1145/3447818.3460373