中文

通用视觉语言模型向新领域的泛化:综合综述

计算机视觉与模式识别 2025-07-01 v2 人工智能

摘要

近年来,视觉语言预训练技术日益成为一种变革性方法,融合了视觉和文本两种模态的优势,产生了强大的视觉语言模型(VLM)。利用大规模预训练数据,这些模型展现出强大的零样象能力。然而,当面对特定领域或专业化的泛化任务时,性能往往会恶化。为此,越来越多的研究致力于将VLM嵌入的丰富知识迁移到各种下游应用中。本综述旨在全面总结VLM文献中的泛化设置、方法、基准测试及结果。深入分析典型VLM结构,依据传输模块的不同,当前文献被划分为基于提示的、基于参数的和基于特征的方法。进一步归纳讨论了每类方法的差异与特征,通过重访典型的迁移学习(TL)设置,为VLMs时代的TL提供了新颖的解释。随后介绍流行的VLM泛化基准测试,并对比评估了所综述方法的性能表现。跟随大规模通用可预训练技术的进步,本综述还讨论了VLM与最新多模态大语言模型(MLLM)之间的关系与差异,如DeepSeek-VL。通过从新颖且实用的泛化视角系统性综述视觉语言研究的浪潮,本综述为当前及未来多模态研究的清晰图景作出了贡献。

关键词

引用

@article{arxiv.2506.18504,
  title  = {Generalizing vision-language models to novel domains: A comprehensive survey},
  author = {Xinyao Li and Jingjing Li and Fengling Li and Lei Zhu and Yang Yang and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2506.18504},
  year   = {2025}
}