探索 GPU 在训练多语语言模型中的潜力
机器学习
2014-04-16 v3 计算与语言
摘要
当前的主要研究趋势之一是异构并行计算的演进。GP-GPU 计算正被广泛使用,且已设计了多种应用以利用 GP-GPU 提供的巨大并行性。虽然 GPU 一直广泛用于计算机视觉领域的图像处理,但很少有人研究 GP-GPU 提供的巨大并行性是否能有效地用于自然语言处理(NLP)任务。在本工作中,我们调查并探索了 GP-GPU 在学习语言模型任务中的能力。具体而言,我们研究了使用深度信念神经网络训练多语(Polyglot)语言模型的性能。我们评估了在 GPU 上训练模型的性能,并提出了提升 GPU 性能的优化方案。我们提出的一项关键优化将涉及梯度计算和更新的函数性能在 GPU 上提高了约 50 倍(针对足够大的批量大小)。我们表明,通过上述优化,GP-GPU 在该任务上的性能提高了约 3-4 倍。我们所做的优化是通用的 Theano 优化,因此可能提升依赖这些操作的其他模型的性能。我们还表明,这些优化使得 GPU 在该任务上的性能现在可与 CPU 相媲美。最后,我们全面评估了 GP-GPU 在此任务中的适用性,并强调了限制在 GPU 上训练多语模型性能的因素。
引用
@article{arxiv.1404.1521,
title = {Exploring the power of GPU's for training Polyglot language models},
author = {Vivek Kulkarni and Rami Al-Rfou' and Bryan Perozzi and Steven Skiena},
journal= {arXiv preprint arXiv:1404.1521},
year = {2014}
}
备注
version 2 (just corrected citation)