以大学习率探索域泛化的平坦极小值
计算机视觉与模式识别
2023-09-13 v1
摘要
域泛化 (DG) 旨在泛化到任意未见域。DG 中改善模型泛化的一种有前景的方法是识别平坦极小值。此任务的典型方法是 SWAD,其沿训练轨迹平均权重。然而,权重平均的成功依赖于权重的多样性,而在小学习率训练时多样性受限。相反,我们观察到利用大学习率可同时促进权重多样性并有助于识别损失景观中的平坦区域。但采用大学习率存在收敛问题,无法通过简单平均训练权重解决。为解决此问题,我们引入一种称为 Lookahead 的训练策略,其对快权重与慢权重进行插值而非平均。快权重以大学习率探索权重空间,其未收敛,而慢权重与之插值以保证收敛。此外,权重插值还通过隐式优化衡量平坦度的局部熵损失来帮助识别平坦极小值。为进一步防止训练过拟合,我们提出两种变体,以加权平均权重或累积历史权重正则化训练权重。利用这一新视角,我们的方法在分类与语义分割域泛化基准上均达到了最先进 (SOTA) 性能。代码见 https://github.com/koncle/DG-with-Large-LR。
引用
@article{arxiv.2309.06337,
title = {Exploring Flat Minima for Domain Generalization with Large Learning Rates},
author = {Jian Zhang and Lei Qi and Yinghuan Shi and Yang Gao},
journal= {arXiv preprint arXiv:2309.06337},
year = {2023}
}