中文

SmoGVLM:一个小型、图增强视觉语言模型

计算机视觉与模式识别 2026-04-21 v1 计算与语言

摘要

大型视觉语言模型(VLMs)在多模态任务上取得强大的性能,但常因幻觉和在知识密集型推理中注意力不足而受到限制。我们提出SmoGVLM,一个小型图增强视觉语言模型,通过图神经网络将结构化知识与视觉和文本模态相结合。我们研究了该方法在各种模型规模(从微型1.3B到大型13B)中的效果。我们的结果表明,使用我们的方法训练的小型模型可实现最高达16.24%的性能提升,甚至超过其更大规模的对手,在较大规模的VLMs和强大的微调基线上均表现出色。这些结果凸显了结构化知识增强对于高效、小规模多模态推理系统的潜力。

关键词

引用

@article{arxiv.2604.16517,
  title  = {SmoGVLM: A Small, Graph-enhanced Vision-Language Model},
  author = {Debjyoti Mondal and Rituraj Singh and Subhadarshi Panda},
  journal= {arXiv preprint arXiv:2604.16517},
  year   = {2026}
}

备注

ICASSP 2026