中文

用于大批量训练的并发对抗学习

机器学习 2022-01-25 v2 人工智能

摘要

大批量训练已成为在使用大量 GPU/TPU 处理器训练神经网络时的常用技术。随着批量增大,随机优化器倾向于收敛到尖锐的局部极小值,导致测试性能下降。现有方法通常使用大量数据增强来增大批量,但我们发现数据增强带来的性能增益随批量增大而减小,且在某一点之后数据增强将变得不足。在本文中,我们提出使用对抗学习来增大大批量训练中的批量。尽管对抗学习是平滑决策面并偏向平坦区域的天然选择,但它尚未成功应用于大批量训练,因为它每一步至少需要两次顺序梯度计算,即使使用大量处理器也会使运行时间比普通训练至少翻倍。为克服该问题,我们提出一种新颖的并发对抗学习(ConAdv)方法,利用陈旧参数解耦对抗学习中的顺序梯度计算。实验结果表明,ConAdv 能在 ImageNet 上的 ResNet-50 训练中成功增大批量同时保持高准确率。特别地,我们展示仅 ConAdv 就能在 96K 批量大小的 ImageNet ResNet-50 训练上达到 75.3% 的 top-1 准确率,且当 ConAdv 与数据增强结合时准确率可进一步提升至 76.2%。这是首个将 ResNet-50 训练批量扩展到 96K 的工作。

关键词

引用

@article{arxiv.2106.00221,
  title  = {Concurrent Adversarial Learning for Large-Batch Training},
  author = {Yong Liu and Xiangning Chen and Minhao Cheng and Cho-Jui Hsieh and Yang You},
  journal= {arXiv preprint arXiv:2106.00221},
  year   = {2022}
}

备注

Accepted to ICLR 2022