中文

DIVEBATCH:通过梯度多样性感知的批大小自适应加速模型训练

机器学习 2025-09-22 v1

摘要

本文的目标是加速机器学习模型的训练,由于大规模深度神经模型的训练在计算上可能非常昂贵,这是一个关键挑战。随机梯度下降(SGD)及其变体被广泛用于训练深度神经网络。与专注于调整学习率的传统方法不同,我们提出了一种新颖的自适应批大小 SGD 算法 DiveBatch,能够动态调整批大小。适应批大小具有挑战性:由于并行计算,使用大批大小效率更高,但小批量训练通常能在更少的 epoch 内收敛且泛化能力更好。为了应对这一挑战,我们引入了基于梯度多样性的数据驱动自适应方法,使 DiveBatch 能够在保持小批量训练泛化性能的同时,提高收敛速度和计算效率。梯度多样性具有充分的理论依据:它源于 SGD 的收敛分析。在合成数据以及 CiFar-10、CiFar-100 和 Tiny-ImageNet 上对 DiveBatch 的评估表明,DiveBatch 的收敛速度明显快于标准 SGD 和 AdaBatch(1.06 -- 5.0 倍),且仅有轻微的性能折衷。

关键词

引用

@article{arxiv.2509.16173,
  title  = {DIVEBATCH: Accelerating Model Training Through Gradient-Diversity Aware Batch Size Adaptation},
  author = {Yuen Chen and Yian Wang and Hari Sundaram},
  journal= {arXiv preprint arXiv:2509.16173},
  year   = {2025}
}