BiSSL:通过双层优化提升自监督预训练与下游微调之间的对齐
机器学习
2026-02-11 v5 人工智能
摘要
从自监督预训练初始化的模型可能 suffer from poor alignment with downstream tasks,这会降低后续微调能够将预训练特征适应至下游目标的程度。为缓解这一问题,我们引入 BiSSL,一种新的双层训练框架,通过双层优化增强自监督预训练模型与下游任务的对齐,此过程在常规微调之前进行。BiSSL 作为常规自监督预训练之后的一个中间训练阶段,旨在解决一个双层优化问题,其中包含 pretext 和 downstream training objectives分别位于其 lower- 和 upper-level objectives 中。这一方法明确地模型化了 pretraining 和 fine-tuning 阶段之间的相互依赖关系,最终导致更好的模型初始化与下游任务对齐。我们提出了一种通用的训练算法,可与广泛的 pretext 和 downstream 任务兼容。使用 SimCLR 和 Bootstrap Your Own Latent 在 ImageNet 数据集上预训练 ResNet-50 主干网络,我们证明了该框架在 12 个下游图像分类数据集以及目标检测上显著提高了准确率。进一步的探索性分析和调查性实验进一步提供了有力证据,表明 BiSSL 增强了下游对齐。
引用
@article{arxiv.2410.02387,
title = {BiSSL: Enhancing the Alignment Between Self-Supervised Pretraining and Downstream Fine-Tuning via Bilevel Optimization},
author = {Gustav Wagner Zakarias and Lars Kai Hansen and Zheng-Hua Tan},
journal= {arXiv preprint arXiv:2410.02387},
year = {2026}
}