中文

CLIP-TD:面向视觉语言任务的 CLIP 定向蒸馏

计算机视觉与模式识别 2023-01-02 v3 人工智能 计算与语言 机器学习 多媒体

摘要

对比语言-图像预训练(CLIP)将视觉与语言模态联结至统一嵌入空间,为视觉语言(VL)任务带来巨大潜力。尽管早期并行工作已开始在部分任务上研究该潜力,重要问题仍待解答:1)CLIP 对未研究的 VL 任务有何益处?2)CLIP 是否在少样本或域偏移场景下提供益处?3)CLIP 能否在不影响推理或预训练复杂度的前提下改进现有方法?本文通过两项关键贡献试图回答这些问题。首先,我们引入一种评估协议,涵盖视觉常识推理(VCR)、视觉蕴含(SNLI-VE)与视觉问答(VQA),并跨越多种数据可用性约束与域偏移条件。其次,我们提出一种称为 CLIP 定向蒸馏(CLIP-TD)的方法,利用动态加权目标对每实例自适应所选令牌,将 CLIP 的知识智能蒸馏至现有架构。实验表明,我们提出的 CLIP-TD 在 VCR 的少样本(最高 51.9%)与域偏移(最高 71.3%)条件下带来显著增益,同时在标准全监督条件下(最高 2%)提升性能,相较其他仅以图像-文本数据预训练的单模型在 VCR 上取得最先进性能。在 SNLI-VE 上,CLIP-TD 在少样本(最高 6.6%)与全监督(最高 3%)条件下均产生显著增益。在 VQA 上,CLIP-TD 在少样本(最高 9%)与全监督(最高 1.3%)条件下提供改进。最后,CLIP-TD 优于利用 CLIP 进行微调的并行工作以及朴素的基线蒸馏方法。代码将公开。

关键词

引用

@article{arxiv.2201.05729,
  title  = {CLIP-TD: CLIP Targeted Distillation for Vision-Language Tasks},
  author = {Zhecan Wang and Noel Codella and Yen-Chun Chen and Luowei Zhou and Jianwei Yang and Xiyang Dai and Bin Xiao and Haoxuan You and Shih-Fu Chang and Lu Yuan},
  journal= {arXiv preprint arXiv:2201.05729},
  year   = {2023}
}

备注

This paper is greatly modified and updated to be re-submitted to another conference. The new paper is under the name "Multimodal Adaptive Distillation for Leveraging Unimodal Encoders for Vision-Language Tasks", https://doi.org/10.48550/arXiv.2204.10496