LightCLIP:面向轻量级视觉-语言模型的多级交互学习
计算机视觉与模式识别
2023-12-04 v1
摘要
诸如 CLIP 的视觉-语言预训练在零样本图像分类和图文检索等多种下游任务上已展现出良好性能。现有大多数类 CLIP 的工作通常采用较大的图像编码器如 ResNet50 和 ViT,而轻量级对应模型则鲜有讨论。本文中,我们提出一种用于训练轻量级 CLIP 模型的多级交互范式。首先,为缓解部分图文对并非严格一一对应的问题,我们通过逐步软化负样本标签来改进传统的全局实例级对齐目标。其次,引入基于松弛二分匹配的令牌级对齐目标,以实现图像块与文本词之间更细粒度的对齐。此外,基于 CLIP 模型精度并不随文本编码器参数增加而相应提升的观察,我们利用额外的掩码语言建模(MLM)目标以最大化缩短后文本编码器的潜力。在实践中,提出一个辅助融合模块,在不同网络阶段将未掩码图像嵌入注入掩码文本嵌入以增强 MLM。大量实验表明,在不引入额外推理计算成本的情况下,所提方法在多个下游任务上取得了更优性能。
引用
@article{arxiv.2312.00674,
title = {LightCLIP: Learning Multi-Level Interaction for Lightweight Vision-Language Models},
author = {Ying Nie and Wei He and Kai Han and Yehui Tang and Tianyu Guo and Fanyi Du and Yunhe Wang},
journal= {arXiv preprint arXiv:2312.00674},
year = {2023}
}