隐藏层自蒸馏用于自监督表征学习
计算机视觉与模式识别
2026-03-17 v1 机器学习
摘要
自监督学习 (SSL) 的当前格局主要由生成方法 (如 MAE) 主导,这些方法重建原始低层数据,或由预测方法 (如 I-JEPA) 主导,这些方法预测高层抽象嵌入。虽然生成方法提供了强大的 grounding,但它们在高冗余模态(如图像)上计算效率低,其训练目标不优先学习高层概念特征。相反,预测方法常因依赖最终层自蒸馏的非平稳目标而 suffer from 训练不稳定性。我们引入 Bootleg,一种桥接这两种方法的方法,通过要求模型预测教师网络多个隐藏层的潜在表示来实现这一点。这种层次化目标迫使模型同时捕获不同抽象程度的特征。我们展示,Bootleg 在 ImageNet-1K 和 iNaturalist-21 的分类以及 ADE20K 和 Cityscapes 的语义分割上显著优于相当的基线(相较于 I-JEPA 提升约 10%),并取得显著成果。
引用
@article{arxiv.2603.15553,
title = {Self-Distillation of Hidden Layers for Self-Supervised Representation Learning},
author = {Scott C. Lowe and Anthony Fuller and Sageev Oore and Evan Shelhamer and Graham W. Taylor},
journal= {arXiv preprint arXiv:2603.15553},
year = {2026}
}