中文

无标签适应视觉语言模型的全面综述

机器学习 2025-08-08 v1 人工智能 计算机视觉与模式识别

摘要

视觉语言模型 (VLM) 在广泛任务上展现出显著的泛化能力。然而,在未进行任务特定适应的情况下直接应用于特定下游情境,性能往往次之不及。为在保持数据效率的同时提升实用性,近期研究越来越关注不依赖标记数据的无监督适应方法。尽管对此领域关注不断增加,但仍缺乏一个统一、以任务为导向的综述。为填补这一空白,我们提供该领域的全面结构化概述。我们提出基于无标记视觉数据可获得性和性质的分类法,将现有方法分为四个关键范式:数据无关迁移 (无数据)、无监督域迁移 (丰富数据)、episodic 测试时适应 (批数据) 和在线测试时适应 (流式数据)。在此框架下,我们分析每一范式关联的核心方法和适应策略,旨在建立该领域的系统性理解。此外,我们回顾了跨 diverse 应用的代表性基准,并指出未来研究的开放挑战和前景方向。一个 actively维护的相关文献存储库已公开于 https://github.com/tim-learn/Awesome-LabelFree-VLMs。

关键词

引用

@article{arxiv.2508.05547,
  title  = {Adapting Vision-Language Models Without Labels: A Comprehensive Survey},
  author = {Hao Dong and Lijun Sheng and Jian Liang and Ran He and Eleni Chatzi and Olga Fink},
  journal= {arXiv preprint arXiv:2508.05547},
  year   = {2025}
}

备注

Discussions, comments, and questions are welcome in \url{https://github.com/tim-learn/Awesome-LabelFree-VLMs}