CLIP-TD:面向视觉语言任务的 CLIP 定向蒸馏
摘要
对比语言-图像预训练(CLIP)将视觉与语言模态联结至统一嵌入空间,为视觉语言(VL)任务带来巨大潜力。尽管早期并行工作已开始在部分任务上研究该潜力,重要问题仍待解答:1)CLIP 对未研究的 VL 任务有何益处?2)CLIP 是否在少样本或域偏移场景下提供益处?3)CLIP 能否在不影响推理或预训练复杂度的前提下改进现有方法?本文通过两项关键贡献试图回答这些问题。首先,我们引入一种评估协议,涵盖视觉常识推理(VCR)、视觉蕴含(SNLI-VE)与视觉问答(VQA),并跨越多种数据可用性约束与域偏移条件。其次,我们提出一种称为 CLIP 定向蒸馏(CLIP-TD)的方法,利用动态加权目标对每实例自适应所选令牌,将 CLIP 的知识智能蒸馏至现有架构。实验表明,我们提出的 CLIP-TD 在 VCR 的少样本(最高 51.9%)与域偏移(最高 71.3%)条件下带来显著增益,同时在标准全监督条件下(最高 2%)提升性能,相较其他仅以图像-文本数据预训练的单模型在 VCR 上取得最先进性能。在 SNLI-VE 上,CLIP-TD 在少样本(最高 6.6%)与全监督(最高 3%)条件下均产生显著增益。在 VQA 上,CLIP-TD 在少样本(最高 9%)与全监督(最高 1.3%)条件下提供改进。最后,CLIP-TD 优于利用 CLIP 进行微调的并行工作以及朴素的基线蒸馏方法。代码将公开。
引用
@article{arxiv.2201.05729,
title = {CLIP-TD: CLIP Targeted Distillation for Vision-Language Tasks},
author = {Zhecan Wang and Noel Codella and Yen-Chun Chen and Luowei Zhou and Jianwei Yang and Xiyang Dai and Bin Xiao and Haoxuan You and Shih-Fu Chang and Lu Yuan},
journal= {arXiv preprint arXiv:2201.05729},
year = {2023}
}
备注
This paper is greatly modified and updated to be re-submitted to another conference. The new paper is under the name "Multimodal Adaptive Distillation for Leveraging Unimodal Encoders for Vision-Language Tasks", https://doi.org/10.48550/arXiv.2204.10496