面向密集视觉预测的大批量优化
计算机视觉与模式识别
2022-10-21 v1
摘要
在大规模数据集上训练大规模深度神经网络具有挑战性且耗时。近期大批量优化的突破是应对该挑战的一种有前景的途径。然而,尽管 LARS 和 LAMB 等现有先进算法在分类模型中取得成功,但目标检测和分割等密集视觉预测的复杂流程仍在大批量训练体制下遭受严重的性能下降。为应对此挑战,我们提出一种简单而有效的算法,称为自适应梯度方差调制器(AGVM),它可以用非常大的批量大小训练密集视觉预测器,带来比先前方法更具吸引力的若干优势。首先,AGVM 能够对齐密集视觉预测器中不同模块(如骨干网络、特征金字塔网络(FPN)、检测和分割头)之间的梯度方差。我们表明,大批量大小训练会因这些模块间梯度方差未对齐而失败,这是先前工作主要忽视的现象。其次,AGVM 是一个即插即用模块,可很好地泛化到许多不同架构(如 CNN 和 Transformers)和不同任务(如目标检测、实例分割、语义分割和全景分割),并且兼容不同优化器(如 SGD 和 AdamW)。第三,我们提供了 AGVM 的理论分析。在 COCO 和 ADE20K 数据集上的大量实验证明了 AGVM 的优越性。例如,它能在 4 分钟内训练完 Faster R-CNN+ResNet50 且不损失性能。AGVM 能在仅 3.5 小时内训练具有十亿参数的目标检测器,将训练时间减少 20.9 倍,同时在 COCO 上达到 62.2 mAP。相关成果发布于 https://github.com/Sense-X/AGVM。
引用
@article{arxiv.2210.11078,
title = {Large-batch Optimization for Dense Visual Predictions},
author = {Zeyue Xue and Jianming Liang and Guanglu Song and Zhuofan Zong and Liang Chen and Yu Liu and Ping Luo},
journal= {arXiv preprint arXiv:2210.11078},
year = {2022}
}
备注
23 pages, 6 figures