中文

自适应 GPU 以实现高效大批量训练的核心机

机器学习 2019-03-05 v3 机器学习

摘要

现代机器学习模型通常使用随机梯度下降(SGD)在 GPU 等大规模并行计算资源上进行训练。增加小批量大小是利用并行计算能力的一种简单直接的方法。对于小批量,批量大小的增加会带来训练时间成比例的减少,这一现象称为线性缩放。然而,将批量大小增加到某一特定值以上不会再带来训练时间的改善。在本文中,我们提出了首个将线性缩放扩展到匹配资源并行计算能力的分析框架。该框架针对一类经典核心机(kernel machines)设计。它自动修改标准核心机以输出数学上等价的预测函数,同时允许扩展的线性缩放,即在给定硬件上更高的有效并行度和更快的训练时间。所得算法准确、有原则且非常快速。例如,使用单个 Titan Xp GPU,在 ImageNet 上以 1.3×1061.3\times 10^6 个数据点和 10001000 个标签进行训练耗时不到一小时,而较小数据集(如 MNIST)仅需数秒。由于参数是基于理论界解析选取的,除选择核与核参数外几乎无需调参,进一步促进了这些方法的实际使用。

关键词

引用

@article{arxiv.1806.06144,
  title  = {Kernel machines that adapt to GPUs for effective large batch training},
  author = {Siyuan Ma and Mikhail Belkin},
  journal= {arXiv preprint arXiv:1806.06144},
  year   = {2019}
}