中文

uCLIP:基于无配对数据的面向多语言的视觉语言模型参数高效扩展

计算机视觉与模式识别 2025-12-09 v2

摘要

对比语言-图像预训练(CLIP)通过利用大规模的英语-图像配对 demonstrating strong generalization across various visual tasks。然而,其对低资源语言的扩展仍受限,主要由于高质量多语言图像-文本数据的稀缺。现有的多语言视觉语言模型在Crossmodal-3600(XM3600)基准测试中,对包括捷克语、芬兰语、克罗米亚语、匈牙利语和罗马尼亚语等在内的多个 underrepresented 语言的检索性能表现 consistently low。为此,我们提出了一个轻量且数据高效的多语言视觉语言对齐框架。我们的做法无需任何图像-文本配对或文本-文本配对,并在训练期间冻结预训练的图像编码器和多语言文本编码器。仅训练一个紧凑的170万参数投影模块,使用英语表示作为语义锚点进行对比损失。这一最小化训练 setup 使即使在监督数据有限的语言上也能实现稳健的多语言对齐。广泛的评估表明,我们的方法在多个多语言检索基准上均表现出色,显著提升了五个 underrepresented 语言中的检索性能,这些语言在现有模型中通常表现不佳。这些发现凸显了基于枢轴的、参数高效的对齐策略对于包容性多模态学习的有效性。

关键词

引用

@article{arxiv.2511.13036,
  title  = {uCLIP: Parameter-Efficient Multilingual Extension of Vision-Language Models with Unpaired Data},
  author = {Dahyun Chung and Donghyun Shin and Yujin Sung and Seunggi Moon and Jinwoo Jeon and Byung-Jun Lee},
  journal= {arXiv preprint arXiv:2511.13036},
  year   = {2025}
}

备注

Our project page can be found at https://dinyudin203.github.io/uCLIP-project/