LLaVA-SG:将场景图作为视觉语义表达于视觉语言模型中
计算机视觉与模式识别
2024-09-02 v2 人工智能
摘要
近期大型视觉语言模型 (VLM) 的进展通常采用基于 Vision Transformer (ViT) 架构的视觉编码器。ViT 将图像划分为多个小块的结果是,视觉感知碎片化,阻碍了 VLM 的视觉理解能力。在本文中,我们提出一种创新性增强方法,通过在 VLM 中引入场景图表达 (SGE) 模块来克服这一限制。该模块从图像中提取并结构化表达复杂语义信息,从而提高 VLM 的基础感知和理解能力。广泛的实验表明,集成我们的 SGE 模块显著增强了 VLM 在视觉语言任务中的性能,表明其在保留复杂语义细节方面的有效性,并促进了更好的视觉理解。
引用
@article{arxiv.2408.16224,
title = {LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models},
author = {Jingyi Wang and Jianzhong Ju and Jian Luan and Zhidong Deng},
journal= {arXiv preprint arXiv:2408.16224},
year = {2024}
}