SILC:利用自蒸馏改进视觉语言预训练
计算机视觉与模式识别
2023-12-08 v2
摘要
得益于 CLIP 及其变体的成功,基于网络规模图像描述数据集的图像-文本预训练已成为开放词汇分类与检索模型的默认范式。若干工作也使用 CLIP 特征用于密集预测任务,并展示了开放集能力的涌现。然而,这些模型所用的对比目标仅关注图像-文本对齐,并未激励面向密集预测任务的图像特征学习。本工作中,我们提出 SILC,一种新颖的视觉语言预训练框架。SILC 通过自蒸馏的局部到全局对应学习的简单增补,改进了图像-文本对比学习。我们展示从指数移动平均(EMA)教师模型蒸馏局部图像特征,显著提升了模型在检测与分割等密集预测任务上的性能,同时也为分类与检索等图像级任务带来改进。SILC 模型在零样本分类、少样本分类、图像与文本检索、零样本分割及开放词汇分割上树立了新标杆。我们进一步展示 SILC 特征极大惠及开放词汇检测、图像描述与视觉问答。
引用
@article{arxiv.2310.13355,
title = {SILC: Improving Vision Language Pretraining with Self-Distillation},
author = {Muhammad Ferjad Naeem and Yongqin Xian and Xiaohua Zhai and Lukas Hoyer and Luc Van Gool and Federico Tombari},
journal= {arXiv preprint arXiv:2310.13355},
year = {2023}
}