中文

揭示视觉Transformer中的良性过拟合:训练动力学、收敛与泛化

机器学习 2024-11-25 v2 计算机视觉与模式识别 机器学习

摘要

Transformer在近期大规模基础模型的开发中展现出巨大潜力。特别是视觉Transformer(ViT)在视觉领域取得了显著的进展,取得了实验方面的重大成就。然而,其在训练过拟合训练数据时的理论能力,特别是泛化能力,仍未完全理解。为填补这一空白,本工作深入探讨了Transformer在视觉任务中发生良性过拟合的视角。为此,我们研究了在特定数据分布模型下,使用梯度下降对由softmax后跟全连接层组成的Transformer进行优化的情形。通过发展针对softmax和Transformer优化中多个权重相互依赖性挑战的技术,我们成功地 characterize了训练动力学并实现了泛化。在训练动力学分析中,我们建立了一个尖锐条件,用于区分小测试误差阶段和大测试误差 regime,基于数据模型中的信噪比。理论结果通过实验模拟进一步得到验证。据我们所知,这是首次对Transformer进行良性过拟合特征进行表征。

关键词

引用

@article{arxiv.2409.19345,
  title  = {Unveil Benign Overfitting for Transformer in Vision: Training Dynamics, Convergence, and Generalization},
  author = {Jiarui Jiang and Wei Huang and Miao Zhang and Taiji Suzuki and Liqiang Nie},
  journal= {arXiv preprint arXiv:2409.19345},
  year   = {2024}
}