中文

面向多语言场景的视觉语言知识蒸馏与对齐渐进框架

计算机视觉与模式识别 2024-04-18 v1

摘要

预训练的视觉语言(V-L)模型如CLIP在许多下游跨模态任务中表现优异。然而,这些模型大多仅适用于英语语境。后续研究致力于此问题,提出改进模型,如CN-CLIP和AltCLIP,以促进其适用于中文乃至其他语言。然而,这些模型在推理时存在高延迟和较大内存占用,限制了其在资源受限的边缘设备上的进一步部署。本文提出一种概念简单却有效的多语言CLIP压缩框架,并训练一个轻量级多语言视觉语言模型,称为DC-CLIP,适用于中文和英语语境。在该框架中,我们收集高质量的中英文本像素对,并设计两个训练阶段,包括多语言视觉语言特征蒸馏和对齐。在第一个阶段,设计轻量级图像/文本学生模型分别从相应教师模型中学习鲁棒的视觉/多语言文本特征表示能力。随后,多语言视觉语言对齐阶段可进一步提高模型的多语言性能。基于ELEVATER基准的全面实验表明,DC-CLIP在英语语境下实现卓越的性能,在中文语境下实现竞争性能,甚至在数据更少的情况下也能以类似参数规模的现有模型实现。该评估表明了我们设计的训练机制的有效性。

关键词

引用

@article{arxiv.2404.11249,
  title  = {A Progressive Framework of Vision-language Knowledge Distillation and Alignment for Multilingual Scene},
  author = {Wenbo Zhang and Yifan Zhang and Jianfeng Lin and Binqiang Huang and Jinlu Zhang and Wenhao Yu},
  journal= {arXiv preprint arXiv:2404.11249},
  year   = {2024}
}