中文

探索视觉语言模型的前沿:当前方法与未来方向综述

计算机视觉与模式识别 2025-10-15 v4 人工智能 计算与语言

摘要

大型语言模型(LLM)的出现极大地重塑了人工智能革命的轨迹。然而,这些 LLM 表现出一个显著的局限性,即它们主要擅长处理文本信息。为了解决这一限制,研究人员努力将视觉能力与 LLM 集成,从而催生了视觉语言模型(VLM)。这些先进的模型在处理图像描述和视觉问答等更复杂的任务中发挥了重要作用。在我们的综合综述论文中,我们深入探讨了 VLM 领域的关键进展。我们的分类将 VLM 组织为三个不同的类别:致力于视觉语言理解的模型,处理多模态输入以生成单模态(文本)输出的模型,以及同时接受和产生多模态输入与输出的模型。这种分类基于它们在处理和生成各种数据模态时的各自能力和功能。我们细致地剖析了每个模型,在可能的情况下对其基础架构、训练数据源以及优势和局限性进行了广泛的分析,为读者提供了对其基本组件的全面理解。我们还在各种基准数据集上分析了 VLM 的性能。通过这样做,我们旨在提供对 VLM 多样化格局的细致理解。此外,我们强调了这一动态领域未来研究的潜在途径,期待进一步的突破和进展。

关键词

引用

@article{arxiv.2404.07214,
  title  = {Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions},
  author = {Akash Ghosh and Arkadeep Acharya and Sriparna Saha and Vinija Jain and Aman Chadha},
  journal= {arXiv preprint arXiv:2404.07214},
  year   = {2025}
}

备注

One of the first survey on Visual Language Models