中文

K-FAC 在大批量训练中的低效性

机器学习 2021-04-21 v3 机器学习

摘要

在随机优化中,训练期间使用大批量大小可利用并行资源,在每个训练轮次产生更快的挂钟训练时间。然而,对于训练损失和测试误差,近期分析大批量随机梯度下降(SGD)的结果发现了明显的收益递减,超出某一临界批量大小后尤为显著。为解决这个问题,有人提出 Kronecker 因子近似曲率(K-FAC)方法可实现对非凸机器学习问题(如神经网络优化)更大批量大小的可扩展性,以及对模型超参数变化更强的鲁棒性。在此,我们对大批量训练的这两种假设进行了详细的实证分析,涵盖 K-FAC 与 SGD,并从挂钟时间与总计算成本两方面评估性能。我们的主要结果有两点:首先,我们发现 K-FAC 与 SGD 在超出某批量大小后均不具备理想的扩展行为,且相较 SGD,K-FAC 并未表现出改进的大批量扩展行为;其次,我们发现 K-FAC 除需调优更多超参数外,还遭受与 SGD 类似的超参数敏感行为。我们讨论了使用 ResNet 和 AlexNet 分别在 CIFAR-10 与 SVHN 上的广泛结果,以及我们发现的更普遍意义。

关键词

引用

@article{arxiv.1903.06237,
  title  = {Inefficiency of K-FAC for Large Batch Size Training},
  author = {Linjian Ma and Gabe Montague and Jiayu Ye and Zhewei Yao and Amir Gholami and Kurt Keutzer and Michael W. Mahoney},
  journal= {arXiv preprint arXiv:1903.06237},
  year   = {2021}
}