中文

迈向高效且可扩展的锐度感知最小化

机器学习 2022-03-08 v1 人工智能 计算机视觉与模式识别

摘要

近来,锐度感知最小化(SAM)将损失景观的几何与泛化能力联系起来,在训练视觉Transformer等大规模模型上展现出显著的性能提升。然而,SAM 的更新规则在每步需要两次顺序的(不可并行化的)梯度计算,这会使计算开销翻倍。本文提出一种新算法 LookSAM——仅周期性地计算内部梯度上升,以显著减少 SAM 的额外训练成本。实证结果表明,LookSAM 取得了与 SAM 相似的精度增益,同时速度快得多——其计算复杂度与 SGD 或 Adam 等一阶优化器相当。为了进一步评估 LookSAM 的性能与可扩展性,我们引入了逐层修改,并在大批量训练场景下开展实验,该场景更易收敛到尖锐的局部极小。我们首次成功地在训练视觉Transformer(ViTs)时将批量大小扩展。借助 64k 的批量大小,我们能在数分钟内从头训练 ViTs,同时保持有竞争力的性能。

关键词

引用

@article{arxiv.2203.02714,
  title  = {Towards Efficient and Scalable Sharpness-Aware Minimization},
  author = {Yong Liu and Siqi Mai and Xiangning Chen and Cho-Jui Hsieh and Yang You},
  journal= {arXiv preprint arXiv:2203.02714},
  year   = {2022}
}

备注

Accepted by CVPR 2022