可视化自监督视觉Transformer的损失景观
计算机视觉与模式识别
2024-05-29 v1 机器学习
摘要
掩码自编码器(MAE)作为一种代表性的自监督方法,用于视觉Transformer的掩码图像建模,引起了广泛关注。然而,尽管MAE显示出比从头开始的完全监督训练更好的泛化能力,其原因尚未被探索。在另一项工作中,提出了重建一致掩码自编码器(RC-MAE),它在MAE中采用了指数移动平均(EMA)教师形式的自蒸馏方案,并且已经表明EMA教师在优化过程中执行条件梯度校正。为了进一步研究MAE训练的自监督ViT(MAE-ViT)更好泛化的原因,以及从优化角度研究RC-MAE梯度校正的效果,我们通过MAE和RC-MAE可视化了自监督视觉Transformer的损失景观,并将其与有监督ViT(Sup-ViT)进行了比较。与之前基于分类任务损失的神经网络损失景观可视化不同,我们通过计算预训练任务损失来可视化ViT的损失景观。通过损失景观的视角,我们发现了两个有趣的观察结果:(1)MAE-ViT比Sup-ViT具有更平滑、更宽的整体损失曲率。(2)EMA教师允许MAE在预训练和线性探测中扩大凸性区域,从而导致更快的收敛。据我们所知,这项工作是首次通过损失景观的视角研究自监督ViT。
引用
@article{arxiv.2405.18042,
title = {Visualizing the loss landscape of Self-supervised Vision Transformer},
author = {Youngwan Lee and Jeffrey Ryan Willette and Jonghee Kim and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2405.18042},
year = {2024}
}
备注
NeurIPS 2023 Workshop: Self-Supervised Learning - Theory and Practice