中文

G-Mix:面向平坦极小值的广义 Mixup 学习框架

机器学习 2023-08-22 v2

摘要

深度神经网络(DNN)在各种复杂任务中已展现出有前景的结果。然而,当前的 DNN 面临过参数化挑战,尤其在可用训练数据有限时。为增强 DNN 的泛化能力,Mixup 技术已广受欢迎。尽管如此,它仍产生次优结果。受成功的 Sharpness-Aware Minimization(SAM)方法启发——该方法建立了训练损失景观的尖锐度与模型泛化之间的关联——我们提出一种称为 Generalized-Mixup 的新学习框架,它结合了 Mixup 与 SAM 的优势来训练 DNN 模型。所提供的理论分析展示了所开发的 G-Mix 框架如何增强泛化。此外,为利用 G-Mix 框架进一步优化 DNN 性能,我们引入两种新算法:Binary G-Mix 与 Decomposed G-Mix。这些算法基于每个样本对尖锐度的敏感性将训练数据划分为两个子集,以解决 Mixup 中的“流形侵入”问题。理论解释与实验结果均表明,所提出的 BG-Mix 与 DG-Mix 算法在多个数据集和模型上进一步增强了模型泛化,取得了 state-of-the-art 性能。

关键词

引用

@article{arxiv.2308.03236,
  title  = {G-Mix: A Generalized Mixup Learning Framework Towards Flat Minima},
  author = {Xingyu Li and Bo Tang},
  journal= {arXiv preprint arXiv:2308.03236},
  year   = {2023}
}

备注

19 pages, 23 figures