中文

Lookaround 优化器:$k$ 步环绕,1 步平均

计算机视觉与模式识别 2023-11-03 v3

摘要

权重平均(WA)是一个活跃的研究课题,因其集成深度网络的方式简单,且在提升泛化能力方面有效。然而,现有的权重平均方法通常以事后方式仅沿一条训练轨迹进行(即整个训练过程结束后才平均权重),这显著削弱了网络间的多样性,从而损害了有效性。本文受权重平均启发,提出 Lookaround,一种直接而有效的基于 SGD 的优化器,可得到更平坦极小值并具备更好泛化性。具体而言,Lookaround 在整个训练期间迭代两步:环绕步与平均步。每次迭代中,1)环绕步从公共点出发,利用不同数据增强变换后的数据同时训练多个网络;2)平均步将这些训练后的网络平均得到平均网络,作为下一次迭代的起点。环绕步提升了功能多样性,而平均步保证了这些网络在整个训练中的权重局部性,这是 WA 生效的关键。我们通过收敛分析从理论上解释了 Lookaround 的优越性,并在包括 CIFAR 和 ImageNet 上使用 CNN 与 ViT 的流行基准上进行了大量实验,证明相对 SOTA 具有明显优势。代码见 https://github.com/Ardcy/Lookaround。

关键词

引用

@article{arxiv.2306.07684,
  title  = {Lookaround Optimizer: $k$ steps around, 1 step average},
  author = {Jiangtao Zhang and Shunyu Liu and Jie Song and Tongtian Zhu and Zhengqi Xu and Mingli Song},
  journal= {arXiv preprint arXiv:2306.07684},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023