中文

大型视觉语言模型综述:对齐、基准、评估与挑战

计算机视觉与模式识别 2025-04-08 v6 人工智能 计算与语言 机器学习 机器人学

摘要

多模态视觉语言模型(VLM)在计算机视觉和自然语言处理的交叉汇聚处,成为一个变革性的话题,使机器能够通过视觉和文本两种模态来感知和推理世界。例如,CLIP、Claude 和 GPT-4V 等模型在视觉和文本数据上展现出强大的推理和理解能力,在零样本分类中甚至超越了经典的单模态视觉模型。随着这些模型在研究和实际应用中的快速发展和日益流行,我们提供了一份全面的 VLM 综述。具体而言,我们在以下方面提供了系统概述:[1] 截至2025年发展的主要 VLM 的模型信息;[2] VLM 架构的演变和最新 VLM 对齐方法;[3] 流行基准和 VLM 评估指标的总结与分类;[4] 当前 VLM 面临的挑战和问题,如幻觉、对齐、公平性和安全性。详细的文献集合包括论文和模型存储库链接列于 https://github.com/zli12321/Vision-Language-Models-Overview。

关键词

引用

@article{arxiv.2501.02189,
  title  = {A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges},
  author = {Zongxia Li and Xiyang Wu and Hongyang Du and Fuxiao Liu and Huy Nghiem and Guangyao Shi},
  journal= {arXiv preprint arXiv:2501.02189},
  year   = {2025}
}

备注

22 pages, 3 figures