中文

LLaVA-SG:将场景图作为视觉语义表达于视觉语言模型中

计算机视觉与模式识别 2024-09-02 v2 人工智能

摘要

近期大型视觉语言模型 (VLM) 的进展通常采用基于 Vision Transformer (ViT) 架构的视觉编码器。ViT 将图像划分为多个小块的结果是,视觉感知碎片化,阻碍了 VLM 的视觉理解能力。在本文中,我们提出一种创新性增强方法,通过在 VLM 中引入场景图表达 (SGE) 模块来克服这一限制。该模块从图像中提取并结构化表达复杂语义信息,从而提高 VLM 的基础感知和理解能力。广泛的实验表明,集成我们的 SGE 模块显著增强了 VLM 在视觉语言任务中的性能,表明其在保留复杂语义细节方面的有效性,并促进了更好的视觉理解。

关键词

引用

@article{arxiv.2408.16224,
  title  = {LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models},
  author = {Jingyi Wang and Jianzhong Ju and Jian Luan and Zhidong Deng},
  journal= {arXiv preprint arXiv:2408.16224},
  year   = {2024}
}