揭示视觉Transformer中的良性过拟合:训练动力学、收敛与泛化
机器学习
2024-11-25 v2 计算机视觉与模式识别
机器学习
摘要
Transformer在近期大规模基础模型的开发中展现出巨大潜力。特别是视觉Transformer(ViT)在视觉领域取得了显著的进展,取得了实验方面的重大成就。然而,其在训练过拟合训练数据时的理论能力,特别是泛化能力,仍未完全理解。为填补这一空白,本工作深入探讨了Transformer在视觉任务中发生良性过拟合的视角。为此,我们研究了在特定数据分布模型下,使用梯度下降对由softmax后跟全连接层组成的Transformer进行优化的情形。通过发展针对softmax和Transformer优化中多个权重相互依赖性挑战的技术,我们成功地 characterize了训练动力学并实现了泛化。在训练动力学分析中,我们建立了一个尖锐条件,用于区分小测试误差阶段和大测试误差 regime,基于数据模型中的信噪比。理论结果通过实验模拟进一步得到验证。据我们所知,这是首次对Transformer进行良性过拟合特征进行表征。
关键词
引用
@article{arxiv.2409.19345,
title = {Unveil Benign Overfitting for Transformer in Vision: Training Dynamics, Convergence, and Generalization},
author = {Jiarui Jiang and Wei Huang and Miao Zhang and Taiji Suzuki and Liqiang Nie},
journal= {arXiv preprint arXiv:2409.19345},
year = {2024}
}