大型视觉语言模型综述:对齐、基准、评估与挑战
计算机视觉与模式识别
2025-04-08 v6 人工智能
计算与语言
机器学习
机器人学
摘要
多模态视觉语言模型(VLM)在计算机视觉和自然语言处理的交叉汇聚处,成为一个变革性的话题,使机器能够通过视觉和文本两种模态来感知和推理世界。例如,CLIP、Claude 和 GPT-4V 等模型在视觉和文本数据上展现出强大的推理和理解能力,在零样本分类中甚至超越了经典的单模态视觉模型。随着这些模型在研究和实际应用中的快速发展和日益流行,我们提供了一份全面的 VLM 综述。具体而言,我们在以下方面提供了系统概述:[1] 截至2025年发展的主要 VLM 的模型信息;[2] VLM 架构的演变和最新 VLM 对齐方法;[3] 流行基准和 VLM 评估指标的总结与分类;[4] 当前 VLM 面临的挑战和问题,如幻觉、对齐、公平性和安全性。详细的文献集合包括论文和模型存储库链接列于 https://github.com/zli12321/Vision-Language-Models-Overview。
引用
@article{arxiv.2501.02189,
title = {A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges},
author = {Zongxia Li and Xiyang Wu and Hongyang Du and Fuxiao Liu and Huy Nghiem and Guangyao Shi},
journal= {arXiv preprint arXiv:2501.02189},
year = {2025}
}
备注
22 pages, 3 figures