中文

面向高分辨率大型视觉语言模型的全局语义引导子图像特征权重分配

计算机视觉与模式识别 2025-01-27 v1 人工智能

摘要

随着对大型视觉语言模型 (LVLMs) 中高分辨率图像处理需求的增长,子图像分割方法日益受到青睐,以缓解固定分辨率处理导致的视觉信息丢失。然而,现有分割方法对子图像的处理均匀,导致图像理解次优。本文揭示,语义上与整体图像高度相关的子图像包含更丰富的视觉信息,有助于保留模型的视觉理解能力。因此,我们提出了全局语义引导权重分配器 (Global Semantic-guided Weight Allocator, GSWA) 模块,依据子图像相对信息密度动态分配权重,模拟人类视觉注意力机制。该方法使模型能够聚焦于更具信息的区域,克服了均匀处理的局限性。我们将 GSWA 集成到 InternVL2-2B 框架中,创建了 SleighVL,一个轻量且性能卓越的模型。大量实验表明,SleighVL 在参数数量相当的模型中表现优于并保持与大型模型的竞争力。我们的工作为 LVLMs 更高效且具有上下文感知的高分辨率图像处理提供了可行方向,推动了多模态系统的发展。

关键词

引用

@article{arxiv.2501.14276,
  title  = {Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models},
  author = {Yuxuan Liang and Xu Li and Xiaolei Chen and Haotian Chen and Yi Zheng and Chenghang Lai and Bin Li and Xiangyang Xue},
  journal= {arXiv preprint arXiv:2501.14276},
  year   = {2025}
}

备注

10 pages, 10 figures and tables