中文

在超越内存限制的同时保持性能实现DNN模型的大批量训练

机器学习 2024-07-03 v3 分布式、并行与集群计算

摘要

近期的深度学习模型难以使用大批量大小进行训练,因为商用机器可能没有足够内存来同时容纳模型与大数据批量。批量大小是训练模型所用的超参数之一,它依赖于并受限于目标机器内存容量,因为在模型载入后批量大小只能适配剩余内存。此外,数据项大小也是重要因素,因为若每项数据尺寸更大,则能放入剩余内存的批量大小就更小。本文提出一种称为微批处理(MBP)的方法来解决该问题。该方法通过提供一种将批量拆分为可放入剩余内存的大小并顺序处理的批处理方法,帮助深度学习模型训练。在分别处理小批量后,采用基于梯度累积的损失归一化算法以维持性能。我们方法的目的是使深度学习模型能够使用超出系统内存容量的更大批量大小进行训练,而无需增大内存或使用多设备(GPU)。

关键词

引用

@article{arxiv.2110.12484,
  title  = {Enabling Large Batch Size Training for DNN Models Beyond the Memory Limit While Maintaining Performance},
  author = {XinYu Piao and DoangJoo Synn and JooYoung Park and Jong-Kook Kim},
  journal= {arXiv preprint arXiv:2110.12484},
  year   = {2024}
}

备注

Published in IEEE Access